{"as_of":"2026-08-15T10:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d946b6dd56e2009de1483ed98a6f6b8a0204880e768e2d129c2ffe758c975338","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:59:59.178147Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T01:14:18.241481Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:41:05.332612Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.00254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00254","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d1caedcc-84b9-4f07-ab3e-b0499b066d15","year":2024},"citing_paper":{"arxiv_id":"2604.19654","last_updated":"2026-04-21T16:43:59Z","snapshot_observed_at":"2026-08-03T10:54:05.806041Z","submitted_at":"2026-04-21T16:43:59Z","title":"FEPLB: Exploiting Copy Engines for Nearly Free MoE Load Balancing in Distributed Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:14:18.241481Z"},"links":{"cited_paper":"/paper/2501.00254","citing_paper":"/paper/2604.19654"},"observation_digest":"sha256:cf5095ef730e59618d5f9fbc34296600cbceb5620034f522af7d5cff59d155ec","observation_id":"70435530-ecf5-457d-a06b-f68f0dd663fc","resolution":{"observed_at":"2026-05-11T13:41:05.334784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00254/citation-record","integrity":"/paper/2501.00254/integrity","json":"/paper/2501.00254/citation-record.json","paper":"/paper/2501.00254"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.064420Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.064420Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:e66c7a36b765ad43b02228cb0e928d90efa0b72e45fb5ffc56ab3f9fc6f0e0f1","observation_id":"0a4ca7bd-69f2-449d-80bf-e397158472d5","resolution":{"observed_at":"2026-08-10T22:59:59.064420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.069210Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.069210Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:3f92a2548fb7e7097a88731129e067a0376ec44db9d8355376b6212108bfd385","observation_id":"e1cd7783-c833-41db-997b-9ea2e48d0093","resolution":{"observed_at":"2026-08-10T22:59:59.069210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.527271Z","title":null,"venue":null,"work_id":"3e6fc6d8-1a11-4aeb-8e4c-8e53227a1a6b","year":2024},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.074213Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:8fbcf1aa7c4fdfd617307d36d1e60bc98e8d06ab1661b9fe8e2d8b9632c5b1a8","observation_id":"ec535dd2-75b7-4bd4-88fb-da89b5811586","resolution":{"observed_at":"2026-08-10T22:59:59.531078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.515477Z","title":null,"venue":null,"work_id":"89ae8ef6-e31f-4907-9aad-fe0af683c21b","year":2024},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.079200Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:451317eb462a1a707fc03ca406313cfef9c0e5dc32d5e60862335f3e43ae5d9d","observation_id":"5e9236c3-5c72-4c3e-b8d8-e3ee622202f7","resolution":{"observed_at":"2026-08-10T22:59:59.519678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-10T22:59:59.083419Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.083419Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:ef179ac1eb520a7b0d86269ed1638d7e5515708d0d124564ef55d167b3e50689","observation_id":"2ba72cbb-9818-4249-907e-b88349f2a86d","resolution":{"observed_at":"2026-08-10T22:59:59.083419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09149","last_updated":"2024-01-22T06:40:44Z","snapshot_observed_at":"2026-08-14T14:09:41.040463Z","submitted_at":"2024-01-17T11:47:59Z","title":"InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09149","snapshot_observed_at":"2026-08-10T22:59:59.087684Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.087684Z"},"links":{"cited_paper":"/paper/2401.09149","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:71425ff96b677115e2ab78a8ca44eb08f008fbe3e94534fae5ad86ab5aab5ebe","observation_id":"e3d21145-a208-4817-9d02-ecc69d364c03","resolution":{"observed_at":"2026-08-10T22:59:59.087684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.500978Z","title":null,"venue":null,"work_id":"4a725f59-4791-4894-97ff-adc144f58e11","year":2012},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.091999Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:97aa6a3457ff0fe444c3b6370418b383317b5e5bf8a5d2866f7f4c9a1b7471cb","observation_id":"00da802b-3eed-4344-9a25-3cd2b544bb04","resolution":{"observed_at":"2026-08-10T22:59:59.505388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T22:59:59.095831Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.095831Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:70cbfd56fc4057b9f905a6e3271639a47add0dd275b3b63203cd1b08e813e7af","observation_id":"8c4e5376-084a-4c39-b74e-d757f39084cf","resolution":{"observed_at":"2026-08-10T22:59:59.095831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.487466Z","title":"V.; Wu, Y.; et al","venue":null,"work_id":"d74ea19d-897d-4733-ba90-dafdfe40afea","year":2019},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.100186Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:901464df36a7ceb642bb36281e164b75a73404d388b4488d45bfafc80b002c73","observation_id":"41d8cddd-8c54-4ea3-a8bb-96fe8b3d46a1","resolution":{"observed_at":"2026-08-10T22:59:59.492312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.475130Z","title":null,"venue":null,"work_id":"9f8ac96a-2d48-42c2-b59c-decf5f731984","year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.103756Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:a4397526673bdb5527df4febb173794aee2f748edad1f729b1ac1576c0fdbc4b","observation_id":"a024b9ed-d512-4e17-ae5a-53c44344860e","resolution":{"observed_at":"2026-08-10T22:59:59.479479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.463198Z","title":null,"venue":null,"work_id":"ce4abfd2-da2f-408b-9bc4-3d813a524d7e","year":2019},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.107648Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:28c8c15ea0d4950338bd0c185e1d1c90c6f6f60a6cd701afaa2e128302301cae","observation_id":"e19cbe07-c47c-402e-b34d-92edabb8cd62","resolution":{"observed_at":"2026-08-10T22:59:59.467316Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T22:59:59.111758Z","title":"B.; Chess, B.; Child, R.; Gray, S.; Radford, A.; Wu, J.; and Amodei, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.111758Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:670e006140adc973666e30521193d70dc73814f8483a18483f7c7ff2601900dd","observation_id":"4a19eb2f-5ea7-4b6e-93a2-ac32ba6b1068","resolution":{"observed_at":"2026-08-10T22:59:59.111758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10465","last_updated":"2021-09-22T00:57:46Z","snapshot_observed_at":"2026-08-13T18:07:35.055898Z","submitted_at":"2021-09-22T00:57:46Z","title":"Scalable and Efficient MoE Training for Multitask Multilingual Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10465","snapshot_observed_at":"2026-08-10T22:59:59.116949Z","title":"J.; Awan, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.116949Z"},"links":{"cited_paper":"/paper/2109.10465","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:caa3aef42bf0b072c68303316ffcc4cbab0b0c0c5f3ca7503249945f1bd74a40","observation_id":"70fd5a5a-ee33-4db2-a7e8-140b92bfc656","resolution":{"observed_at":"2026-08-10T22:59:59.116949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.451512Z","title":"A.; Casper, J.; Lym, S.; McAfee, L.; Andersch, M.; Shoeybi, M.; and Catanzaro, B","venue":null,"work_id":"9ac969fe-399a-4df5-bd7c-1a87e15817b5","year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.121192Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:f9b73b6421af58dcbae6aadc84083b7fa8d13937a1c88efb256b73261ec3cc42","observation_id":"ca580d36-833d-4acf-b6f2-f4df59407a06","resolution":{"observed_at":"2026-08-10T22:59:59.455960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.440197Z","title":"G.; Park, J","venue":null,"work_id":"b5fed07b-1faa-4a95-9da9-042a76d0a69d","year":2014},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.125657Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:1e8019b73f2ecd5425070a6011f85caae56a83beac5ac2faa4cfa8d75543db70","observation_id":"8d81d586-569c-4428-add5-432a8b67e78d","resolution":{"observed_at":"2026-08-10T22:59:59.443614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.429456Z","title":"G.; Smola, A","venue":null,"work_id":"2e09f6ee-7a79-41c2-8db0-289444a0d7d0","year":2014},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.129603Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:17e4e1299c6aa0e458e55b1d28795efb9ba1d8869990aef984dab176e3684de5","observation_id":"0a47f1cd-248c-4a0c-b6b1-a0f66dd2f60b","resolution":{"observed_at":"2026-08-10T22:59:59.432815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-10T10:23:27.892451Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-10T22:59:59.133758Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.133758Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:c1084ebab18e2b78c509e6c83f745beffeef68abd738eec9e23b89af3b67409e","observation_id":"253fd9db-d347-4c64-ad4f-2a0c238ffe64","resolution":{"observed_at":"2026-08-10T22:59:59.133758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.415278Z","title":null,"venue":null,"work_id":"274cde05-55d0-4a00-9084-de8748a112e6","year":2022},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.138257Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:842565c67e467f7acd018cc2273e7e61ba9b4b0d3f3d0dbec6bcc893e25a2486","observation_id":"56487cc7-2d6a-43ca-bf81-3f706a88714f","resolution":{"observed_at":"2026-08-10T22:59:59.419919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.401800Z","title":null,"venue":null,"work_id":"9f489987-5b23-4dbd-9f4a-ea47090ebe2a","year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.142064Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:0854d5dc014b822fe08b3285cb387d97286c4f2f462d3021c87e80633b8fc2e0","observation_id":"df52d0a5-e554-4b57-aa13-28474cd4e060","resolution":{"observed_at":"2026-08-10T22:59:59.406399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-08T01:15:17.906950Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-10T22:59:59.146149Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.146149Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:e8d3712697bc084304d07439c3afc7d8eb57a8856c66f304868558080b814472","observation_id":"e815fc39-0ed3-46ec-a5df-920a95bf6b17","resolution":{"observed_at":"2026-08-10T22:59:59.146149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10241","last_updated":"2023-11-30T10:40:34Z","snapshot_observed_at":"2026-08-13T05:13:34.244145Z","submitted_at":"2023-11-30T10:40:34Z","title":"Zero Bubble Pipeline Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10241","snapshot_observed_at":"2026-08-10T22:59:59.150576Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.150576Z"},"links":{"cited_paper":"/paper/2401.10241","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:75eea41f37a91559972f56cfbc983a52ec30ac726aad376472e297bb244b3654","observation_id":"79d021ef-6ae1-44fe-8362-db3e968f3bbc","resolution":{"observed_at":"2026-08-10T22:59:59.150576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.387140Z","title":null,"venue":null,"work_id":"d57d0c24-c9de-45b7-85a1-92456e516c38","year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.155418Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:df3160babd228b3a410ea76ba23857d3d6e07d64ffc63ec2b21aef21f683fdd9","observation_id":"b06433d2-5fed-4dfa-b671-346cdf92fa9a","resolution":{"observed_at":"2026-08-10T22:59:59.391551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.372193Z","title":null,"venue":null,"work_id":"80912a40-94d4-4364-acbd-33c4c9c85f94","year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.158802Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:fbf53c963123f3b30a32cfdb9ba5342c7208d652bcaa397f66cbef0fc13fda31","observation_id":"78f6b8bc-17d3-4e88-a119-54d0ad170fb8","resolution":{"observed_at":"2026-08-10T22:59:59.376801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.359325Z","title":null,"venue":null,"work_id":"ade62e9f-9214-4c38-9dda-5751c8855736","year":2020},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.161921Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:d0da366c0f91898d1eaee1eb9600250f0cbad2d708126c33a8ac369f7deb8170","observation_id":"fb123771-5030-4810-939e-e2fc7fa8deb0","resolution":{"observed_at":"2026-08-10T22:59:59.363138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T22:59:59.164785Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.164785Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:bb0a26e44f752894cc14d88485c67b3f59113b012c1a7e9190463a235e8832ed","observation_id":"f0e7a721-ec93-426c-8a0f-3d8db157732c","resolution":{"observed_at":"2026-08-10T22:59:59.164785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.347963Z","title":"S.; Maggioni, M.; Zhang, Q.; et al","venue":null,"work_id":"61ae6364-3440-458f-ab2d-ae0428544cb0","year":2022},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.168191Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:cdb04850c09a051e669b261f8cf921a497cc6624ca0116574d06e8e0c804b1c1","observation_id":"ce86d84f-7806-4000-b5ca-4f18cf2d6484","resolution":{"observed_at":"2026-08-10T22:59:59.351884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-14T19:59:05.307983Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-10T22:59:59.171724Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.171724Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:e271bffe1997c7dbe5c9eaf764b672bc45f43776a222dea8d7dc9b21180d81a7","observation_id":"cbd6fbc5-5dac-4ef5-9e36-6d9b0c411356","resolution":{"observed_at":"2026-08-10T22:59:59.171724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:59.334337Z","title":null,"venue":null,"work_id":"4bbcf91d-915b-459e-80fa-3862b29d3480","year":2021},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.175222Z"},"links":{"citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:f64ea7a0d272cf186c61e8f3c66746fe73f6bc1aa6c727117b86625fa91714c5","observation_id":"48fe7f2c-14e8-4f04-bc82-56569f372f4e","resolution":{"observed_at":"2026-08-10T22:59:59.339475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07410","last_updated":"2024-08-14T09:34:19Z","snapshot_observed_at":"2026-08-12T23:03:50.741581Z","submitted_at":"2024-08-14T09:34:19Z","title":"Aquila2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07410","snapshot_observed_at":"2026-08-10T22:59:59.178147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:59:59.178147Z"},"links":{"cited_paper":"/paper/2408.07410","citing_paper":"/paper/2501.00254"},"observation_digest":"sha256:debe7b8c6bae3c7a506819094d669433f1656f5d4f3a9546a62030a4974a6240","observation_id":"d72a9cd7-eb1a-47a8-827a-d9a9fcc4c144","resolution":{"observed_at":"2026-08-10T22:59:59.178147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00254","last_updated":"2024-12-31T03:51:14Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T06:16:45.769709Z","submitted_at":"2024-12-31T03:51:14Z","title":"Automatically Planning Optimal Parallel Strategy for Large Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2501.00254."}