{"as_of":"2026-08-11T04:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b1123096e17e1810f7ddbd7e760b384356bdfa6fe391f9723b2c3f489228e54","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:20:02.783216Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.08145/citation-record","integrity":"/paper/2502.08145/integrity","json":"/paper/2502.08145/citation-record.json","paper":"/paper/2502.08145"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.273723Z","title":"Super: Sub-graph parallelism for transformers,","venue":null,"work_id":"406d0300-1193-48c6-b41c-2cf864ef3395","year":2021},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.624115Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:95f5b66d72cc79362b5a055b3133e1777cd37423546e548a4f6ccfb111975520","observation_id":"cfe60ddb-b8d2-4770-b176-54ab30e9e410","resolution":{"observed_at":"2026-08-08T10:20:05.277436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.266051Z","title":"Scaling distributed deep learning work- loads beyond the memory capacity with karma,","venue":null,"work_id":"e089d0dd-cd90-4d41-9b36-e4cf564c8c6c","year":2020},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.628041Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:4dbf8841b8ae30c037f566c394a6df57f48d6ae5082f5d2c988084ff57c5eda4","observation_id":"e6e52360-d80b-4c1f-a0da-591463fe3c47","resolution":{"observed_at":"2026-08-08T10:20:05.268993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.258122Z","title":"Forge: Pre-training open foundation models for science,","venue":null,"work_id":"f93efd24-ee2e-4b16-af2d-fc584ac93ef4","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.631258Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:4d9266b68f6a3f7ef10a7bb908f38b201b2a5d85057c09dbad12c61bae5161db","observation_id":"173818ab-a30e-46b0-8e04-3a0b664a992f","resolution":{"observed_at":"2026-08-08T10:20:05.261411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.248839Z","title":"Optimizing distributed training on frontier for large language models,","venue":null,"work_id":"7168a576-6d7b-4b2c-b3b6-21e09c35bde5","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.634237Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:df6cf37662aaf1584089726a06ace45425a01610239fd9f61a65fdc5edb70cc0","observation_id":"05f24982-92c5-4040-a46f-8d80de8a20a7","resolution":{"observed_at":"2026-08-08T10:20:05.251706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.239773Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model,","venue":null,"work_id":"21db730a-f7d5-41a8-abfb-c8fccf748075","year":2022},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.638603Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:b932d5d375056c9a15a4f88d6b3bbee61fc15190a8133d9c8c43d936ff513108","observation_id":"ae7568c9-1fd7-465d-8c55-ee1c7922a044","resolution":{"observed_at":"2026-08-08T10:20:05.242863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-08T01:15:17.906950Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-08T10:20:02.642128Z","title":"Efficient large-scale language model training on GPU clusters,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.642128Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:c78cf038080f40376f41df01f4a6b1075efa850fde7200d25ac02174bc23f390","observation_id":"fb0670d6-8efc-4d2e-b247-9226f418704c","resolution":{"observed_at":"2026-08-08T10:20:02.642128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.231069Z","title":"MegaScale: Scaling large language model training to more than 10,000 GPUs,","venue":null,"work_id":"f20c8294-e23b-4830-9ccb-c4eec834466c","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.645980Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:a1f4dc281c13e7e43ef7a92948f71f8b4994d36661d26946e5477d7327e2961a","observation_id":"e5e73c07-1c20-43a9-b9c3-b2cccfb97aa8","resolution":{"observed_at":"2026-08-08T10:20:05.234090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.221471Z","title":"Google cloud demonstrates the world’s largest distributed training job for large language models across 50000+ tpu v5e chips,","venue":null,"work_id":"66e1875c-8ffb-4433-9e4f-012d36d378d6","year":null},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.649415Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:2de50cd3dc816b7de4ba9e2ef2052e614a0b35e7379cc45b37f4f7243a96b1be","observation_id":"5fb685db-f7b6-4a83-b6f5-0fb09d67e5db","resolution":{"observed_at":"2026-08-08T10:20:05.224647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.212704Z","title":"AxoNN: An asynchronous, message-driven parallel framework for extreme-scale deep learning,","venue":null,"work_id":"cf7d2f77-d907-4093-bd48-f6b10bc839b4","year":2022},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.652845Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:883fd2775d27f1c66f36f6893b726fd4aa09488b17115cb75647421e33ae39e6","observation_id":"d31439de-b84f-43b5-ab93-7aff0e022af2","resolution":{"observed_at":"2026-08-08T10:20:05.215715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.952781Z","title":"Exploiting sparsity in pruned neural networks to optimize large model training,","venue":null,"work_id":"adc9a204-1f10-4970-9235-42125bc8d36e","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.655642Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:2f1d1bb4574958286590c9720c72e74819f9159cbc626d63e1e08972c4410c17","observation_id":"34d2b012-dcf0-4de7-9aac-58efaec82c63","resolution":{"observed_at":"2026-08-08T10:20:04.956493Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.203265Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":"0ab48153-9043-431e-9416-af7d425f92d1","year":2020},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.659372Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:c53d09f2e1fc8de67ea21a49a027a49229bd95e89435ba35789ea96cda9cf150","observation_id":"92cc03c1-322f-49ff-9c7e-96cfae54dcd9","resolution":{"observed_at":"2026-08-08T10:20:05.206332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.193981Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel,","venue":null,"work_id":"580438e4-8870-44d7-8f9c-93bea637b829","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.662349Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:ac84ce386cb23980a9c9b6a71d7b9b2ed5a8f5a36a40b8c40d2f97e15e5f2543","observation_id":"15d514db-84c9-449c-8c4d-b2e5864ee6fd","resolution":{"observed_at":"2026-08-08T10:20:05.197454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.175570Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism,","venue":null,"work_id":"ede2d737-91e8-4b51-9225-dd8b954ed35f","year":2020},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.668560Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:1c26e86b16cc006e72c7a6168f5cdf709aa817e26a0d1eaa44f8da5e74511737","observation_id":"3adfc4b9-0a73-4fa5-ad42-26269b8f8431","resolution":{"observed_at":"2026-08-08T10:20:05.179145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.167566Z","title":"GPipe: efficient training of giant neural networks using pipeline parallelism,","venue":null,"work_id":"9bfdc574-5256-4ef8-baa0-0de87d108cf1","year":2019},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.671345Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:21b0b90c978c70779313174d5f22b217b447f0d94c414e4056802367e0a212d8","observation_id":"a4b70986-2b49-46e6-8dc1-4fe17fee7aca","resolution":{"observed_at":"2026-08-08T10:20:05.170498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.159048Z","title":"Deepspeed: Extreme-scale model training for everyone,","venue":null,"work_id":"31146221-abca-4532-ae3e-1c55569322be","year":null},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.674012Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:c583ac16bed76632f4da585e13dcaebb331b51d517262e1f0478a4dc7e11309b","observation_id":"d1a34e15-d91d-4c5d-9bd6-52060981d60c","resolution":{"observed_at":"2026-08-08T10:20:05.162555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.605011Z","title":"A hybrid tensor-expert-data parallelism approach to optimize mixture-of-experts training,","venue":null,"work_id":"da0b5c67-57d5-4ece-ae27-edde24f52a50","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.677289Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:f2a1aeec141b67c2eb38b10cce5303f888f2291af2ae06da3f900a6b6a89a55c","observation_id":"e8091f37-6dfe-4fa1-8251-e0e7012908a5","resolution":{"observed_at":"2026-08-08T10:20:04.609477Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.149234Z","title":"GPT-NeoX: Large Scale Autoregressive Language Modeling in PyTorch,","venue":null,"work_id":"7c51769b-500b-47ba-a9bd-5878602042e3","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.680393Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:830f6ee9dfce7209ddc3b2d703516f4b2cdb9bd370e7e263706a9fccbebe8975","observation_id":"1dc7ce9b-2044-4557-8c17-4858138b72d0","resolution":{"observed_at":"2026-08-08T10:20:05.152654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12023","last_updated":"2022-06-28T19:36:44Z","snapshot_observed_at":"2026-08-07T05:15:09.810779Z","submitted_at":"2022-01-28T10:13:35Z","title":"Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12023","snapshot_observed_at":"2026-08-08T10:20:02.683674Z","title":"Alpa: Automating inter- and intra-operator parallelism for distributed deep learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.683674Z"},"links":{"cited_paper":"/paper/2201.12023","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:4ee808993860a249f0ee7d3ffd0f19e4f922c7cf9f865c1439ebad47c92f7644","observation_id":"2a4c607d-2d59-4ad5-aba4-f0ec474863d6","resolution":{"observed_at":"2026-08-08T10:20:02.683674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.140984Z","title":"Colossal-AI: a unified deep learning system for large-scale parallel training,","venue":null,"work_id":"0189db92-2bc8-43a6-a7ca-19a2ae3fb873","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.686844Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:be6aca204a36c954416dc0e47ff2fea7950a4be5d275224ac38d483091842684","observation_id":"6f350aae-1cf5-48ed-b4fd-71628a22086c","resolution":{"observed_at":"2026-08-08T10:20:05.144149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.130824Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":"849f33fa-96a4-4adb-af70-3a163c8e3a19","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.689764Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:3d6470bdf41d8c69ece5640eff8e5f19abc59669c7b4833240104069536c926d","observation_id":"8854f878-52af-44af-9404-6ff66b5a0ad9","resolution":{"observed_at":"2026-08-08T10:20:05.133794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-08T10:20:02.692885Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.692885Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:e45138cc07b6a2df4e27590f1eeef2cc7e2302299b0cad9061a28ca605981566","observation_id":"8b3f9544-2386-40d4-9509-223cf5ea0c6e","resolution":{"observed_at":"2026-08-08T10:20:02.692885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.122578Z","title":"LBANN: livermore big artificial neural network HPC toolkit,","venue":null,"work_id":"aeeb8dfc-5c43-4d73-8ac6-a55939a3e794","year":2015},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.696500Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:74ae535f33d9c06608774f2dd08e2521843bd57836edc549a4b6f61ed61debd9","observation_id":"9ba13cb0-3cdc-4355-a15a-12751caef3c7","resolution":{"observed_at":"2026-08-08T10:20:05.125390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.114023Z","title":"Nvidia selene supercomputer,","venue":null,"work_id":"c9303df8-cb98-4053-8c40-8322b93c667a","year":null},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.699888Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:479a6ddf9cb8ffd8c4740030d2e3c69b2dbcdd87e8c2c55e23c686cb4f5bb702","observation_id":"bfd7db8b-9d6c-4dd3-bd2e-e40fcaf5ce0d","resolution":{"observed_at":"2026-08-08T10:20:05.117015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.106063Z","title":"Frontier: Exploring exascale,","venue":null,"work_id":"884e8802-b344-4b94-97f2-fbde894419e9","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.703399Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:f94ca90275e5e1c121fc1ca0dfe1b998e7ddf76d4186dcafa7cff0f0bea519ab","observation_id":"d6c41d50-7547-4753-9b5c-04cfec9da0fd","resolution":{"observed_at":"2026-08-08T10:20:05.108866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.097213Z","title":"A three-dimensional approach to parallel matrix multiplication,","venue":null,"work_id":"36522df2-82f8-4281-8450-733f74d3d96e","year":1995},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.706230Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:efe65b8986ca0ae3a6a1d4c34295173e97258ebb4df630f44c5061b05e19617e","observation_id":"02f325f9-583f-4c53-9893-f82b4e765e40","resolution":{"observed_at":"2026-08-08T10:20:05.100532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.185423Z","title":"ZeRO++: Extremely efficient collective communication for large model training,","venue":null,"work_id":"96b06754-4ba8-438d-9315-bdf10dd50c2c","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.709021Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:7e128a53253044c06e7323a6d7ee0883439f32001b792aa89ec69527df3510d0","observation_id":"38b79e32-95e6-49cb-a25c-afe97b3a2065","resolution":{"observed_at":"2026-08-08T10:20:05.188445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.087778Z","title":"Improving the performance of collective operations in mpich,","venue":null,"work_id":"ab6e8d52-c5f7-47c4-a8d9-9409a149d534","year":2003},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.712838Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:c35f41b08cb55f4b29fe2e0326f82597c798ce6e988a6dc2df25fd7914459bb8","observation_id":"fb5c813e-084a-4de4-9796-71e62a58cd82","resolution":{"observed_at":"2026-08-08T10:20:05.091221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.079550Z","title":"Optimization of collective reduction operations,","venue":null,"work_id":"5bbef7d6-b6d3-4965-a34e-ea9f4bebf2a2","year":2004},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.715458Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:2ac29ad892346cc28a8493eddd0ae0a443ee9c21ea4c3944d6aff363557fdc9c","observation_id":"961544f7-2ae5-40f2-877b-6060c90bdeb0","resolution":{"observed_at":"2026-08-08T10:20:05.082585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:03.297713Z","title":"Improving communication performance in dense linear algebra via topology aware collectives,","venue":null,"work_id":"3f2f7c50-4324-4fa2-9f99-656a1094a174","year":2011},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.718427Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:4184af9e9af801f331dbc19c4e72030b87dfa499a6516a7a3063bddb9d2925e4","observation_id":"027f16fe-75f9-4c37-b9be-d0606c3646e4","resolution":{"observed_at":"2026-08-08T10:20:03.301128Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/sc.20","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:02.816545Z","title":"Mapping applications with collectives over sub-communicators on torus networks,","venue":null,"work_id":"616187f3-b96d-466a-b6f2-15a26cee2f09","year":2012},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.721918Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:f63eecf4db720fb2d9e2d88cc7c860676a0cb7a417b15ff200443f0341de55a8","observation_id":"2856382c-b8dc-419c-9ece-b2bb727d5dbb","resolution":{"observed_at":"2026-08-08T10:20:02.820258Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/sc.2014.32","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"RAHTM: Routing- algorithm aware hierarchical task mapping,","venue":null,"work_id":"101171f1-c3fe-43c1-8d99-375dbdadadca","year":2014},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.725877Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:047cfd7a50157fdf6aa7879b068fa3c53dfd6927e2d6cd40b0a0e787405c01a6","observation_id":"ffae8d80-2e29-432e-8d87-6220294e365e","resolution":{"observed_at":"2026-08-08T10:20:02.809304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:03.044532Z","title":"Optimizing the performance of parallel applications on a 5D torus via task mapping,","venue":null,"work_id":"798f61bb-6add-49f7-88b9-1b7df5a357f3","year":2014},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.728858Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:35e633546d185cbc0d4fca48063802b61316054eb3d360679d11665dc6423883","observation_id":"18f394f7-eb24-445c-80cb-9b33769fb30e","resolution":{"observed_at":"2026-08-08T10:20:03.048400Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.070607Z","title":"Supervised learning based algorithm selection for deep neural networks,","venue":null,"work_id":"23d072e4-eccb-425c-8db4-46bc2b9c0748","year":2017},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.732776Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:20327412b6391f24f3514b0d4d181c76f3cd403136cd5662317b02e37946ea5d","observation_id":"fa8248a8-893e-42fb-8106-6fa3d1da566c","resolution":{"observed_at":"2026-08-08T10:20:05.073494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T10:20:02.735880Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.735880Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:09add773eab8c80ae3e0964aac314a08140316918311c8421cebed8cd9043c83","observation_id":"bcbddde1-a435-4540-98b6-c815a313d1fd","resolution":{"observed_at":"2026-08-08T10:20:02.735880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-08T10:20:02.739697Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.739697Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:cf9545a16ce34df236a96ad466e3ee9d8bcbfb00ea4e709b618899f70a67d103","observation_id":"25f95a0b-c2c5-408b-85ae-6bb5b9478acc","resolution":{"observed_at":"2026-08-08T10:20:02.739697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.061762Z","title":"Bigscience large open-science open-access multilingual language model,","venue":null,"work_id":"21af213c-e0fe-4a22-be38-59623337fd2b","year":2022},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.742736Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:82c2f0556fc9f53b67ac1d90d00dae593180690d14e8693f3341705b07285280","observation_id":"b6d68b7c-b16a-48b5-9784-ea7c3494d9d0","resolution":{"observed_at":"2026-08-08T10:20:05.065419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.052768Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"634ea8e1-dd12-48b4-a643-6321f01a5b5b","year":2019},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.746066Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:fe6d0577569fea34bc4f023ced72b377ceb4f99a69237db1068ef51b2c028759","observation_id":"9a5e2c51-0a27-4a59-85c6-11fea84bdb77","resolution":{"observed_at":"2026-08-08T10:20:05.056115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-08T09:03:25.135475Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-08T10:20:02.748714Z","title":"Training deep nets with sublinear memory cost,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.748714Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:ffa7052e7f69bc70e485af5cd89f3510e840c135695e09a071524599f1ca7b04","observation_id":"3a6163ec-71d9-4a64-9421-e53764fd4d5f","resolution":{"observed_at":"2026-08-08T10:20:02.748714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12322","last_updated":"2019-06-13T17:55:30Z","snapshot_observed_at":"2026-08-04T04:17:53.148033Z","submitted_at":"2019-05-29T10:50:32Z","title":"A Study of BFLOAT16 for Deep Learning Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12322","snapshot_observed_at":"2026-08-08T10:20:02.751774Z","title":"A study of BFLOAT16 for deep learning training,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.751774Z"},"links":{"cited_paper":"/paper/1905.12322","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:d147cf67cf603d70e1901c449b27f0bdef620b27afd045d15421f75f4b480989","observation_id":"933cbc24-0067-4915-9828-d982de5f4ef6","resolution":{"observed_at":"2026-08-08T10:20:02.751774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.043039Z","title":null,"venue":null,"work_id":"65330618-3c22-4ab0-ac46-08ea2c4536f0","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.754450Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:d452fdbc15b331f5573f0f1ddc8af5b4eadf088d01b2184b3d79181f5ba25c0e","observation_id":"43ef57a5-c4a9-4925-8a90-b4a201bfa18f","resolution":{"observed_at":"2026-08-08T10:20:05.046128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.033817Z","title":"Interactive investigation of traffic congestion on fat-tree networks using TreeScope,","venue":null,"work_id":"b4b9fdcb-9bcf-43b6-b4f9-9e57b0aac175","year":2018},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.757875Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:bb7537791646156d7103f133c77b2c3809e362022dd6ab6ace53d5de16f142aa","observation_id":"7920df23-0bb7-4aa8-a738-cf3dca58ebf1","resolution":{"observed_at":"2026-08-08T10:20:05.036954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.024631Z","title":"Quantifying I/O and communication traffic interference on dragonfly networks equipped with burst buffers,","venue":null,"work_id":"84b45857-ec48-4d06-83b2-832995d4a2cd","year":2017},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.761481Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:0c771ff9fbc10d811a19e8fc7b392d00bfbf03c7bc2616b922199954fe6c6096","observation_id":"0f67b059-0295-489a-8c68-5dbbec1579ef","resolution":{"observed_at":"2026-08-08T10:20:05.028284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.015475Z","title":"Quantifying memorization across neural language models,","venue":null,"work_id":"7e1a155f-c42b-427c-91a1-c45575a6ae0a","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.764626Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:6fa734bec11b8b9c86b5b7a8818b4b9bb275a307bd0b1cc40c5863262dd98d59","observation_id":"26feff98-4dfa-4171-9546-48f55f5f623d","resolution":{"observed_at":"2026-08-08T10:20:05.018885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:05.005545Z","title":"The times sues openai and microsoft over ai use of copyrighted work,","venue":null,"work_id":"ea5a9905-f95c-488d-bd87-b120aa17e0b2","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.768307Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:8c7b2bc8ad9e47428b37e0ce0d56da0eac34c215f79ce010597fb522e41ae88e","observation_id":"648bc8e9-bf90-4fe9-b9dd-27e200a2238b","resolution":{"observed_at":"2026-08-08T10:20:05.008971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:02.771544Z","title":"Extracting training data from large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.771544Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:60c830e0042a428716a05d329cc1e2d428a7e07c01ecb731e03c58be32c5378d","observation_id":"9efce775-2041-4e4a-ab0f-cbf5d21b4bf6","resolution":{"observed_at":"2026-08-08T10:20:02.771544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.991140Z","title":"Pythia: A suite for analyzing large language models across training and scaling,","venue":null,"work_id":"0990e70e-6724-438d-8a9a-d9b54d26dcd2","year":2023},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.774029Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:08a897fd1e9a7bd6c1b5ee3eff39f08ee0299e5c51b2e87a54173b491cb0e818","observation_id":"9d69f755-c00b-4b91-97d0-6c7080ca91fa","resolution":{"observed_at":"2026-08-08T10:20:04.994313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.982607Z","title":"Tinyllama: An open-source small language model,","venue":null,"work_id":"d7a190a6-5f29-4892-acfa-6c9a1ce17ba7","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.777191Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:9f3eef999cce57fe3919cf17969a8571c714b38434825fb974cc968fd8061d9d","observation_id":"178cdb6d-caa0-4152-ae75-80a4004fa1dc","resolution":{"observed_at":"2026-08-08T10:20:04.985533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:20:04.973723Z","title":"The llama 3 herd of models,","venue":null,"work_id":"ec5d9011-4da5-4c4e-821d-2211015d187b","year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.780659Z"},"links":{"citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:e268b3b4a6f312cdb695b3cab14eb09f9c38ce6be4147108e58d1d13a84a4f08","observation_id":"df901eb7-3427-494b-baae-7e033835fb2a","resolution":{"observed_at":"2026-08-08T10:20:04.976637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10209","last_updated":"2024-11-02T23:19:18Z","snapshot_observed_at":"2026-08-05T02:50:00.813169Z","submitted_at":"2024-06-14T17:44:22Z","title":"Be like a Goldfish, Don't Memorize! Mitigating Memorization in Generative LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10209","snapshot_observed_at":"2026-08-08T10:20:02.783216Z","title":"Be like a goldfish, don’t memorize! mitigating memorization in generative llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T10:20:02.783216Z"},"links":{"cited_paper":"/paper/2406.10209","citing_paper":"/paper/2502.08145"},"observation_digest":"sha256:d3f29b7e63388ff330785521109ee2d76015870fda7f6aab93b8a02ebd5f4a00","observation_id":"2145c077-2e84-45e2-9e97-4ed4002bfff4","resolution":{"observed_at":"2026-08-08T10:20:02.783216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08145","last_updated":"2025-02-12T06:05:52Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T02:19:48.003174Z","submitted_at":"2025-02-12T06:05:52Z","title":"Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":5,"verified_fuzzy":33},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2502.08145."}