{"as_of":"2026-08-19T19:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8db0e54af08ebf797b788d35909d9b7e5e19ea14387b2d945bcd616b389da45","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:04:35.588702Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:01:42.265205Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T06:41:44.858043Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"cited_work":{"arxiv_id":"2504.19232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19232","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptra: Straggler-resilient hybrid-parallel training with pipeline adaptation","venue":null,"work_id":"3c2c7c95-5cb4-4c49-993e-a8b00140cc6d","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-08-14T13:41:43.311887Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-08T05:15:09.654940Z"},"links":{"cited_paper":"/paper/2504.19232","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:bba6977a050d2d7e6b8edffbb9f805f4a4e33688701c1d1d2c3574fe877d9968","observation_id":"993329e5-db85-4264-97e6-8a6aff9b9b9c","resolution":{"observed_at":"2026-05-11T21:31:15.912603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"cited_work":{"arxiv_id":"2504.19232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19232","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptra: Straggler-resilient hybrid-parallel training with pipeline adaptation","venue":null,"work_id":"3c2c7c95-5cb4-4c49-993e-a8b00140cc6d","year":2025},"citing_paper":{"arxiv_id":"2605.06374","last_updated":"2026-05-11T13:11:57Z","snapshot_observed_at":"2026-08-14T13:41:43.311887Z","submitted_at":"2026-05-07T14:52:54Z","title":"ResiHP: Taming LLM Training Failures with Dynamic Hybrid Parallelism","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:42.265205Z"},"links":{"cited_paper":"/paper/2504.19232","citing_paper":"/paper/2605.06374"},"observation_digest":"sha256:df7ece40c5967f0bebb62b62214462af1371eef72ae3035e87ef39c2d1928cb1","observation_id":"6b6f1df8-4c35-4b50-8767-088c04899e1b","resolution":{"observed_at":"2026-05-12T06:41:44.863146Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"cited_work":{"arxiv_id":"2504.19232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.19232","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adaptra: Straggler-resilient hybrid-parallel training with pipeline adaptation","venue":null,"work_id":"3c2c7c95-5cb4-4c49-993e-a8b00140cc6d","year":2025},"citing_paper":{"arxiv_id":"2605.08962","last_updated":"2026-05-09T13:59:27Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:59:27Z","title":"MegaScale-Omni: A Hyper-Scale, Workload-Resilient System for MultiModal LLM Training in Production","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T02:04:07.344134Z"},"links":{"cited_paper":"/paper/2504.19232","citing_paper":"/paper/2605.08962"},"observation_digest":"sha256:3d9899872b499f528f91fd809c7d2d5df00f8f0bedf061a54cb60c732fb2ae85","observation_id":"4fdc623d-d305-4449-aa6e-ea5e6b0026f3","resolution":{"observed_at":"2026-05-12T02:06:14.954658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.19232/citation-record","integrity":"/paper/2504.19232/integrity","json":"/paper/2504.19232/citation-record.json","paper":"/paper/2504.19232"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T06:04:35.351955Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.351955Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:501165b3b2f277859c46bdc4327da704026557ced46182a7293f6e7f251db7d3","observation_id":"d74d4bdf-0c4b-40ab-a904-dba4f3ec18a3","resolution":{"observed_at":"2026-08-16T06:04:35.351955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00550","last_updated":"2025-02-25T18:59:04Z","snapshot_observed_at":"2026-08-16T13:38:28.071613Z","submitted_at":"2024-06-30T00:45:58Z","title":"Ethereal: Divide and Conquer Network Load Balancing in Large-Scale Distributed Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00550","snapshot_observed_at":"2026-08-16T06:04:35.357100Z","title":"Challenging the need for packet spraying in large-scale distributed training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.357100Z"},"links":{"cited_paper":"/paper/2407.00550","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:1aa743ca65264a52a07d983083feeaa48394706f2f67642e9103a8754b839886","observation_id":"cd9bf8e2-e655-427f-a258-10a7ea3419f6","resolution":{"observed_at":"2026-08-16T06:04:35.357100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.540123Z","title":"Conga: Distributed congestion-aware load balancing for datacenters","venue":null,"work_id":"c2e6961a-3378-4973-a6f9-462060d85796","year":2014},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.361564Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:b1aee524499aff52e79758030d6359311e24fb4759f7faf2680ef08160a8556a","observation_id":"45a9577d-22e3-4bb9-8dc3-cd57c172b3f0","resolution":{"observed_at":"2026-08-16T06:04:36.545686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:35.366251Z","title":"Varuna: scal- able, low-cost training of massive deep learning models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.366251Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:f0e095ed51d15c2dc8c8c9131cd8d9a7f6b717dfd0fec76f0f22746b11ae5467","observation_id":"1b68bad4-bba1-4888-8417-30458ed933ea","resolution":{"observed_at":"2026-08-16T06:04:35.366251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.514036Z","title":"Crux: Gpu-efficient communication scheduling for deep learning training","venue":null,"work_id":"706799a6-c6e2-491f-9e45-136a923d2b92","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.370833Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:db476974ae97389795aabd07017d9cf62a76733a90410efcfd0f77c8e2ddb93d","observation_id":"7809112a-468a-41f7-999c-f33166243c4d","resolution":{"observed_at":"2026-08-16T06:04:36.519218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.00981","last_updated":"2017-03-21T07:44:39Z","snapshot_observed_at":"2026-08-14T22:03:08.190474Z","submitted_at":"2016-04-04T18:40:05Z","title":"Revisiting Distributed Synchronous SGD","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.00981","snapshot_observed_at":"2026-08-16T06:04:35.375253Z","title":"Revisiting distributed syn- chronous sgd","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.375253Z"},"links":{"cited_paper":"/paper/1604.00981","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:c6eacee96ea014e2ca0d94e2cde0433d7588300828fe5945cc81193507f36241","observation_id":"44d2fda3-0bc3-48b7-b1b1-b0ee2880c92e","resolution":{"observed_at":"2026-08-16T06:04:35.375253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:35.380526Z","title":"Mscclang: Microsoft collective communication language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.380526Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:c4b911d6ee6d3bba2a43a36fca65ee4165b871febaec4d462cc2a05afc8b628e","observation_id":"e2c35aa4-f977-4e31-8e7e-e0ec3368dff0","resolution":{"observed_at":"2026-08-16T06:04:35.380526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:35.384723Z","title":"Xputimer: Anomaly diagnostics for divergent llm training in gpu clusters of thousand-plus scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.384723Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:ba16557c68d1fc9a8faa7f6207f148f553794138c6315594e8a2f9f0619a89ba","observation_id":"973776e0-62b1-4b68-8a01-d8f9ea148ff6","resolution":{"observed_at":"2026-08-16T06:04:35.384723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.488179Z","title":"On the impact of packet spraying in data center networks","venue":null,"work_id":"2fcf0b6c-e192-4ee3-8291-635ff080968c","year":2013},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.388929Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:e79cf1ca7f989d855fe8dcb0959850abe7c1a35ac08b0969ba55081fe528a6d9","observation_id":"d6756975-bfa0-402f-989c-0805f5af2d65","resolution":{"observed_at":"2026-08-16T06:04:36.493711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.472351Z","title":"ACCL: Architecting highly scalable distributed training systems with highly efficient collective communication library","venue":null,"work_id":"240827a7-8d7e-43e7-964a-fb0f6baa4a23","year":2021},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.393299Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:fcb281a571c566cba38feedbf136db5915839ef52ff0ffc3a61416c5f69b623d","observation_id":"e536f1e9-d560-4c82-a803-03e1b91c912c","resolution":{"observed_at":"2026-08-16T06:04:36.477648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T06:04:35.397576Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.397576Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:e69a2ed389c5f7efab09345cb5e9d220f775f41ba6604371251bfcb20d5d8034","observation_id":"7d9c6fce-38ec-4ed8-b4ae-d9d48b7a4d0b","resolution":{"observed_at":"2026-08-16T06:04:35.397576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.455533Z","title":"Recycle: Resilient training of large dnns using pipeline adaptation","venue":null,"work_id":"b113c371-17b3-4f96-86a7-7d4f42ae6160","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.402234Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:09d60bb3373fcfe845b7dcafa5a2e0ae23692db5a48c1b1bca134dfadd1ce372","observation_id":"bcf63b55-1d15-42e7-8a11-7a182ad336cf","resolution":{"observed_at":"2026-08-16T06:04:36.460550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.438043Z","title":"Rdma over ethernet for distributed training at meta scale","venue":null,"work_id":"690fb9a2-4723-4d0d-9b6b-1d5510575753","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.406632Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:d0ee159c321501c7ea6b334bdc34354f9ab9c572934573103e9f4b1429b0eac8","observation_id":"44952ce9-bdd7-4543-9b6a-1f601503e472","resolution":{"observed_at":"2026-08-16T06:04:36.444051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T06:04:35.410895Z","title":"Deepseek-r1: Incentiviz- ing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.410895Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:1279fdb36828b5e1d52ccb121623291e5cfc7c1feb6ceb737fa1bce5f35a82ea","observation_id":"73d7c4e9-bb42-4978-8d66-4dbf16cab18f","resolution":{"observed_at":"2026-08-16T06:04:35.410895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.422895Z","title":"Addressing the straggler problem for iterative convergent parallel ml","venue":null,"work_id":"8096af4f-7745-4ffa-8ea7-4c00dca98fa4","year":2016},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.415075Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:8f4442a965b13dc521aa83a6ab0d7fe55982d9b48e0031e230e97060f2c9b937","observation_id":"cf75e0af-1757-44b2-86f7-417c793ba105","resolution":{"observed_at":"2026-08-16T06:04:36.427808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.407895Z","title":"Characterization of large language model development in the datacenter","venue":null,"work_id":"815f1e60-bdc0-4304-accf-cde5e4202123","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.419209Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:2a74b2b78c5fc8ad1d26edfdc3537024fbbde38ac6f92c69a5de5dacc21f5855","observation_id":"ee3a00ec-ed5b-496f-8ef4-de871c17d87d","resolution":{"observed_at":"2026-08-16T06:04:36.412562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:35.423164Z","title":"Gpipe: Effi- cient training of giant neural networks using pipeline parallelism","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.423164Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:a3553b6930a8ebbc5a507ae1bbed2e9e8eaedf58b378ed2e5d47fc0017a27509","observation_id":"112058d7-43e0-4434-96ac-2bbe43c99399","resolution":{"observed_at":"2026-08-16T06:04:35.423164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.383300Z","title":"Gloo, 2025","venue":null,"work_id":"5571e9ab-5fdb-463b-a155-8008ad78931e","year":2025},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.427165Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:5fd9412588fc4f581a3da30961768b9ba38dd9258fdb82116422980e49b53979","observation_id":"6355f156-879e-4286-9c6a-3e9a86cffaaf","resolution":{"observed_at":"2026-08-16T06:04:36.388430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.367564Z","title":"Oobleck: Resilient distributed training of large models using pipeline templates","venue":null,"work_id":"d1db05ff-1e02-42dd-b3b7-bcb61ad9ada9","year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.431231Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:617681a5767ec0d25771efcb34eefc1fddae5b946fa02a76758effceeda32d6b","observation_id":"f8f8e873-a8dd-4d8b-8bda-31c6d6a239d2","resolution":{"observed_at":"2026-08-16T06:04:36.372362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.353075Z","title":"Analysis of{Large-Scale}{Multi-Tenant}{GPU} clus- ters for{DNN} training workloads","venue":null,"work_id":"71f48e1b-2730-4ab4-9dd1-9bf29b837178","year":2019},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.435748Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:45629c190e17c6632151eb87d4a93fea6d1488f9860835105f6ec5ea10e4ccd9","observation_id":"9702dcae-e710-4eb5-aecf-5d957ea62a85","resolution":{"observed_at":"2026-08-16T06:04:36.357838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.337956Z","title":"MegaScale: Scaling large language model training to more than 10,000{GPUs}","venue":null,"work_id":"dc3828da-7ba2-4f62-a435-e098506e2f7b","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.439696Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:59704ae5d9543d49e1c1270069958290caca0f93974795396840a2ac0e1bd2fc","observation_id":"ecd09150-628d-4146-bc81-255a900b04a9","resolution":{"observed_at":"2026-08-16T06:04:36.342295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T06:04:35.444019Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.444019Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:45c072e7dba5d62d280b0bd60cb11a5c5b8e91fea425ec20738ce5b09f73132e","observation_id":"71b0085e-0de1-49fb-a5c5-eb433a1324b3","resolution":{"observed_at":"2026-08-16T06:04:35.444019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15266","last_updated":"2024-07-23T23:32:19Z","snapshot_observed_at":"2026-08-18T20:56:39.421796Z","submitted_at":"2024-07-21T21:00:11Z","title":"STrack: A Reliable Multipath Transport for AI/ML Clusters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15266","snapshot_observed_at":"2026-08-16T06:04:35.448686Z","title":"Strack: A reliable multipath trans- port for ai/ml clusters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.448686Z"},"links":{"cited_paper":"/paper/2407.15266","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:12c8e2761f861de513a197b38813359a03cca55004085a5e4a9f2a227e5229ea","observation_id":"7a3cd834-edb9-4103-af28-232065c24e4f","resolution":{"observed_at":"2026-08-16T06:04:35.448686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13333","last_updated":"2025-05-06T03:19:32Z","snapshot_observed_at":"2026-08-16T13:08:30.726565Z","submitted_at":"2024-10-17T08:45:15Z","title":"Malleus: Straggler-Resilient Hybrid Parallel Training of Large-scale Models via Malleable Data and Model Parallelization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13333","snapshot_observed_at":"2026-08-16T06:04:35.453139Z","title":"Malleus: Straggler-resilient hybrid parallel training of large-scale models via mal- leable data and model parallelization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.453139Z"},"links":{"cited_paper":"/paper/2410.13333","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:13f5b48c9508de196f6b8a175911c949ae6ae90f666ca868f51d4bdb617a4755","observation_id":"082547a8-f895-45c3-9a47-7fe1f1ec5f78","resolution":{"observed_at":"2026-08-16T06:04:35.453139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06511","last_updated":"2025-06-07T19:16:22Z","snapshot_observed_at":"2026-08-17T13:46:06.833799Z","submitted_at":"2024-10-09T03:26:11Z","title":"TorchTitan: One-stop PyTorch native solution for production ready LLM pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06511","snapshot_observed_at":"2026-08-16T06:04:35.457714Z","title":"Torchtitan: One-stop pytorch native solution for production ready llm pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.457714Z"},"links":{"cited_paper":"/paper/2410.06511","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:492ea70543cfdbafc709eb533f1b9c7ffdcbdc4de716cb1c0de21b2ca62d7d40","observation_id":"9cb8ee2c-6895-4b44-b563-c18723bbc92f","resolution":{"observed_at":"2026-08-16T06:04:35.457714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-16T06:04:35.462080Z","title":"Deepseek-v3 techni- cal report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.462080Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:1fc451012c7b0be90e44aaece96821f494fa65c983e2ba61d0e58fd68b78b83e","observation_id":"f308572a-6deb-490e-8966-4122a000f855","resolution":{"observed_at":"2026-08-16T06:04:35.462080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.323439Z","title":"Sdpipe: A semi-decentralized framework for heterogeneity-aware pipeline-parallel training","venue":null,"work_id":"f81d4a8c-24b3-414c-9a7b-d6b7d5c426e2","year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.466205Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:56684895256d602bc285c0e5aff3f0bd32ed638a9a12950a59ac999820d53119","observation_id":"b9767681-5a80-403a-b1fb-1ec3739013fb","resolution":{"observed_at":"2026-08-16T06:04:36.328178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.308806Z","title":"{CheckFreq}: Frequent, {Fine- Grained}{DNN} checkpointing","venue":null,"work_id":"6896b233-5eb7-40de-95dd-8ef0652c8a2c","year":2021},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.470390Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:841756a345a18b89263ce8253bd76c5fe80c87962bedb4e85d2b6ba5b9078a9c","observation_id":"a1de021c-919a-4da1-bff1-a1e5f6af30db","resolution":{"observed_at":"2026-08-16T06:04:36.313632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:35.474543Z","title":"Pipedream: Gen- eralized pipeline parallelism for dnn training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.474543Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:4c9a32089a4ecfc65b96b68642e6af78d6ed401e75b737956e9b2363d0276299","observation_id":"7a7e9161-6c13-40ba-961c-fa24856e6798","resolution":{"observed_at":"2026-08-16T06:04:35.474543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:35.478525Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.478525Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:563447c97d5cf8d3ff531b00eb3780b67f594c88239858b23072a4ab4ff1bf67","observation_id":"6d65604b-10e8-4a69-9a6f-affcf60a9ecd","resolution":{"observed_at":"2026-08-16T06:04:35.478525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.273843Z","title":"Nvidia nsight systems, 2025","venue":null,"work_id":"ac463d64-6b18-46a1-91d1-5afb22ab1c3c","year":2025},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.482698Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:9c97d48e583d877a8d32bd7f1ac6c608bdfaa3c0bdfca6c4d61f5d5c03b0a351","observation_id":"d59b5674-c390-4f1a-9c63-1febb4337fb7","resolution":{"observed_at":"2026-08-16T06:04:36.278860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.258778Z","title":"Openai sora, 2024","venue":null,"work_id":"83b1ae9b-f655-4a60-aec0-3784842e1a9a","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.486953Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:f2332f369b82475c2345327f7ebb84a98d5655e16c0a700ac4c03046ff0a56e7","observation_id":"b2b7cb45-6cc8-41e2-ad3f-544024a9804b","resolution":{"observed_at":"2026-08-16T06:04:36.263552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10241","last_updated":"2023-11-30T10:40:34Z","snapshot_observed_at":"2026-08-19T04:47:56.733959Z","submitted_at":"2023-11-30T10:40:34Z","title":"Zero Bubble Pipeline Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10241","snapshot_observed_at":"2026-08-16T06:04:35.491430Z","title":"Zero bubble pipeline parallelism","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.491430Z"},"links":{"cited_paper":"/paper/2401.10241","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:5f7d1e8ef02a5f6ab48399d1df79f7d0f0d7647cf809bb6cfee71590fc545ef4","observation_id":"06708ac2-2204-45ea-ade2-2209f032de1c","resolution":{"observed_at":"2026-08-16T06:04:35.491430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:35.496340Z","title":"Alibaba hpn: A data center network for large language model training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.496340Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:c2a5ca1b643e66eac69b3d831ac19b7d6caf0fe543e31e39f082636bf8988a29","observation_id":"9d71e85f-cffc-4bc4-be41-8b08ea2abc3c","resolution":{"observed_at":"2026-08-16T06:04:35.496340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.233847Z","title":"In 21st USENIX Sympo- sium on Networked Systems Design and Implementation (NSDI 24), pages 1403–1420, 2024","venue":null,"work_id":"0680a76c-d65e-47a7-9441-77316e16d003","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.500750Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:fa5016795c506cf77f3347aa4796679d436de2f1389f6edd2891c4c86e77ae5d","observation_id":"a2e8750e-f5d9-4e11-b680-3bad814175d0","resolution":{"observed_at":"2026-08-16T06:04:36.239147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.219599Z","title":"Zero: Memory optimizations toward train- ing trillion parameter models","venue":null,"work_id":"52bba2dc-767a-4645-96ba-b210ef5fe99d","year":2020},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.505449Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:da3a13d8230b5cfb9eeb92ea378bbc5f98e4e50d1bf1f1dcef0ef6f92637cb1b","observation_id":"2f9c70b8-9d18-4b4e-826d-8e046b4b5d70","resolution":{"observed_at":"2026-08-16T06:04:36.224364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.205501Z","title":"Redis - the real-time data platform,","venue":null,"work_id":"3a8baaff-0f5c-4a7c-ad28-d927e0e9131b","year":null},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.509698Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:fffb9be9c7d05ebefdd32ab809a1716796682f6fb5c597c0878a6b9a40eedc14","observation_id":"8c1fef91-ae7e-4a07-b410-3b4acb8b9a57","resolution":{"observed_at":"2026-08-16T06:04:36.210074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-16T06:04:35.518187Z","title":"BLOOM: A 176b- parameter open-access multilingual language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.518187Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:80d4448b1d917a7afcfb62a0635a6cbe0c7f475f48980775b77e585b0f7171ba","observation_id":"fdae3e64-3c20-45fb-adfb-1abcb093ec01","resolution":{"observed_at":"2026-08-16T06:04:35.518187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.175711Z","title":"15 {TACCL}: Guiding collective algorithm synthesis us- ing communication sketches","venue":null,"work_id":"3a701028-6c05-4ed6-b3fe-c6c610eea6ff","year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.522538Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:2bcb16dc2da6397d04dbd5718b715ff806efa0385f7fd9a918f45dd5fa71cebd","observation_id":"2c12f68b-b558-49e5-bd2f-b6c6b7e8d598","resolution":{"observed_at":"2026-08-16T06:04:36.180837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-16T06:04:35.526609Z","title":"Megatron-LM: Training multi-billion parameter lan- guage models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.526609Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:8766331544c23ced58fb2c52271d7ed844687a5b053b8c22388ba9b25cf3401e","observation_id":"3636a8e1-ff83-4123-945e-32b278e264c9","resolution":{"observed_at":"2026-08-16T06:04:35.526609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.159559Z","title":"Effective multi-gpu communication using multiple cuda streams and threads","venue":null,"work_id":"63c89d68-1eb7-4724-9238-310cfc77044d","year":2014},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.531209Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:33ac8f07b22c78e4ef2b45c6ca591ec1ebaa1c8bf1140d4af285c6c8c964383c","observation_id":"008d5325-e487-4053-a835-10295e13b62d","resolution":{"observed_at":"2026-08-16T06:04:36.165947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T06:04:35.535751Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.535751Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:f3e29185627f241f153a410da9a2d5f7e075bc02a0545ae73cccb6535e7e7be6","observation_id":"478520f2-4b7f-4eac-be7e-bdb029ffc66d","resolution":{"observed_at":"2026-08-16T06:04:35.535751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.143819Z","title":"Multipath issues in unicast and multicast next-hop selection","venue":null,"work_id":"08c09e9a-4378-4f71-8e2e-c2508356b416","year":2000},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.540439Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:da20bed8797dafcbef048bc84c586d35547371cfd187de0335019c4c26ff96eb","observation_id":"91639a0a-436e-4d98-bb9e-897f3127be7a","resolution":{"observed_at":"2026-08-16T06:04:36.149049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.126719Z","title":"Bamboo: Making preemptible in- stances resilient for affordable training of large{DNNs}","venue":null,"work_id":"d296e539-f8d3-4c43-b59d-a9b6a5ac4885","year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.544844Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:0c08912cae24fc6b176bed516caee5e51d011cebe56f91ebbfa5b04529004014","observation_id":"abd4ffa9-2844-4527-aafd-908623d2144a","resolution":{"observed_at":"2026-08-16T06:04:36.132596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.111862Z","title":null,"venue":null,"work_id":"c1772dbb-a6bd-41cb-872b-5ada661850af","year":1975},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.549001Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:9240f7f8f08e950407a573552de1e7fe675dba316b23a6961f5f08524b07f0d2","observation_id":"737b7469-9cca-4a80-a317-cb61d54cfe71","resolution":{"observed_at":"2026-08-16T06:04:36.116305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.02852","last_updated":"2022-07-05T20:55:38Z","snapshot_observed_at":"2026-08-16T16:48:07.135932Z","submitted_at":"2022-07-05T20:55:38Z","title":"Machine Learning Model Sizes and the Parameter Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.02852","snapshot_observed_at":"2026-08-16T06:04:35.553102Z","title":"Ma- chine learning model sizes and the parameter gap","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.553102Z"},"links":{"cited_paper":"/paper/2207.02852","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:96abcad03e3c27b471be1c294100a71db837ff53342be368350d5cc9fdb6e025","observation_id":"efec145c-f2d8-4a5b-9e57-5ce95568108f","resolution":{"observed_at":"2026-08-16T06:04:35.553102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.097267Z","title":null,"venue":null,"work_id":"ace361fe-5a9a-4424-9f85-f32c36d3494c","year":2023},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.557340Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:bac309bef94c4cc0649be8235172fb71e3ae28cf3d703e025273e3ceb22c9f44","observation_id":"83dbe049-21b1-4a10-887e-0a75e01576b2","resolution":{"observed_at":"2026-08-16T06:04:36.101833Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12588","last_updated":"2024-10-16T14:07:35Z","snapshot_observed_at":"2026-08-17T17:55:18.315879Z","submitted_at":"2024-10-16T14:07:35Z","title":"FALCON: Pinpointing and Mitigating Stragglers for Large-Scale Hybrid-Parallel Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12588","snapshot_observed_at":"2026-08-16T06:04:35.561757Z","title":"FALCON: Pinpointing and mitigating stragglers for large-scale hybrid-parallel train- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.561757Z"},"links":{"cited_paper":"/paper/2410.12588","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:6654523d433b21c7b59eaf662217744c08f69c9a8361f42dd560c9d3863abde8","observation_id":"515c1cfd-aeee-40a1-907d-199fd3edadb7","resolution":{"observed_at":"2026-08-16T06:04:35.561757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.081628Z","title":"SuperBench: Improving cloud AI infrastructure reliability with proactive valida- tion","venue":null,"work_id":"57e8cabc-89ce-4b75-ba38-a624a221e76c","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.566306Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:e1d4f42d3f80bd967e752b1d665101b3e6fe9b3b0c630f4427a5ddbd363d44cb","observation_id":"dd9a87e4-729d-4d9e-a12c-e8ec670a6cca","resolution":{"observed_at":"2026-08-16T06:04:36.086589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-16T06:04:35.570749Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.570749Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:da8e2f598ca170ec98f106a62a4665b8d259941c226adc5500bc52e56dbe6ef7","observation_id":"01713743-2cfc-4cd6-a2a1-d3f3ba13f9a0","resolution":{"observed_at":"2026-08-16T06:04:35.570749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.067146Z","title":"Deepep: an efficient expert- parallel communication library","venue":null,"work_id":"788026ff-df79-4b4a-a020-76179ff8981c","year":2025},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.575683Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:5a74f2fffbc91142e711306df94301cbd9494a22393258d6b9613748ca909cff","observation_id":"a4661709-0b82-40d1-a79c-3b14c627054d","resolution":{"observed_at":"2026-08-16T06:04:36.071765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:35.579912Z","title":"Alpa: Automating inter-and{Intra-Operator} parallelism for distributed deep learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.579912Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:6a3e02ebc03fefa94047a2a37b22d04e3dee27c9661a6c7c5b29329dba2ada62","observation_id":"76aceb5e-156f-4b05-b449-495db70c8516","resolution":{"observed_at":"2026-08-16T06:04:35.579912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13221","last_updated":"2025-04-22T14:32:59Z","snapshot_observed_at":"2026-08-16T13:16:59.537080Z","submitted_at":"2024-09-20T05:15:38Z","title":"Optimizing RLHF Training for Large Language Models with Stage Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13221","snapshot_observed_at":"2026-08-16T06:04:35.584122Z","title":"Rlhfuse: Efficient rlhf training for large language models with inter-and intra- stage fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.584122Z"},"links":{"cited_paper":"/paper/2409.13221","citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:2fe85cd16b3abbe5ec81b59b6ccf85b2234d64f739d0ae54fc59359bdbf85f61","observation_id":"c6a1ef8f-7425-4c68-84b8-56fdcbf10192","resolution":{"observed_at":"2026-08-16T06:04:35.584122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.040087Z","title":"Falcon: Addressing strag- glers in heterogeneous parameter server via multiple par- allelism","venue":null,"work_id":"2ad93b72-860b-4880-b9ec-2a79700c02a8","year":2020},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.588702Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:b0337ed283535eaa3fb2b59b1c3d5f51adc3dffa11651a8399b84c584497c857","observation_id":"ac0ef10c-bb91-4194-bd6b-b677f151c632","resolution":{"observed_at":"2026-08-16T06:04:36.047577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T06:04:36.190291Z","title":null,"venue":null,"work_id":"d7ad368d-7f9e-48de-8df8-0162f359ab8e","year":2024},"citing_paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:35.514136Z"},"links":{"citing_paper":"/paper/2504.19232"},"observation_digest":"sha256:acec20eb341bebaed9fe7dd4ef14d698e896ace6fd3f47c4682ffadec912c8a1","observation_id":"180f88ec-4369-4ab4-af3f-02594c6bc224","resolution":{"observed_at":"2026-08-16T06:04:36.194887Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.19232","last_updated":"2025-04-27T13:18:13Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-17T13:46:51.619124Z","submitted_at":"2025-04-27T13:18:13Z","title":"Adaptra: Straggler-Resilient Hybrid-Parallel Training with Pipeline Adaptation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":28,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 3 inbound Pith citation observations for arXiv:2504.19232."}