{"as_of":"2026-08-10T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f02eb282c8ec33e25224e46ecc1207b42267dd4b6c7dd3e0955c897f48baa2a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:16:16.508011Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:39:46.806179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:26d3f0473322b711e0e365514f0e0d2caa40527ae958c021e3a457f86ffb8fe2","observation_id":"b7f674bf-6ba0-432b-ad68-b49b25746a3f","resolution":{"observed_at":"2026-05-16T09:46:10.164904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T06:36:57.165551Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2402.08268"},"observation_digest":"sha256:63f483e366032050f666b7a0d1ed34b70ad357564080535f73aaf141e6607dc1","observation_id":"03e34ab8-7ec6-42be-a8fa-b3947023d55f","resolution":{"observed_at":"2026-05-16T06:36:57.307966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:47:27.775529Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2403.04652"},"observation_digest":"sha256:1d5d21e49a102ef2af0413ec660c60efbc4265cad5be2249ed27a6586902c806","observation_id":"664367ad-fd64-46f2-95fe-9a4d17909af8","resolution":{"observed_at":"2026-05-13T05:47:27.874603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-08T21:16:16.508011Z","title":"Sequence parallelism: Long se- quence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.508011Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:dbd71e6a84fad17be0b2a2572ff35f86d95a77161fe5f56f085b50c008dd049d","observation_id":"9e654174-9035-441a-afb5-2289664958c6","resolution":{"observed_at":"2026-08-08T21:16:16.508011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-08T21:07:32.343801Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-08T21:00:11.502449Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T21:07:32.343801Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2502.04896"},"observation_digest":"sha256:3a46bfcdbc896b551a02afaa2624264e257ff7c43d46f3873c0fa597a952bb05","observation_id":"2745746e-9eee-48bf-99c8-1b28bb474655","resolution":{"observed_at":"2026-08-08T21:07:32.343801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T14:52:55.653397Z","title":"Sequence paral- lelism: Long sequence training from system perspective.arXiv preprint arXiv:2105.13120, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17315","last_updated":"2026-06-02T22:13:24Z","snapshot_observed_at":"2026-08-07T22:00:02.564609Z","submitted_at":"2025-05-22T22:09:47Z","title":"Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:55.653397Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2505.17315"},"observation_digest":"sha256:d91bd9f8f39a0cd88484c3c2eea3bcc24a57dd9d294b1b7d8107ce33a9b11af2","observation_id":"1c57709c-5045-4694-aebb-90fad6e68c7b","resolution":{"observed_at":"2026-08-07T14:52:55.653397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T14:47:55.986399Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17694","last_updated":"2026-03-28T10:14:51Z","snapshot_observed_at":"2026-08-07T14:40:02.904487Z","submitted_at":"2025-05-23T10:03:28Z","title":"CoDec: Prefix-Shared Decoding Kernel for LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.986399Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2505.17694"},"observation_digest":"sha256:f76d06ab6b840f158611554917139939330399d230038c5bf89641656b1e1111","observation_id":"519d403c-33f9-416e-a771-6143d673a16c","resolution":{"observed_at":"2026-08-07T14:47:55.986399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T14:20:25.288961Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19293","last_updated":"2026-06-02T22:08:40Z","snapshot_observed_at":"2026-08-07T14:15:05.692688Z","submitted_at":"2025-05-25T19:58:31Z","title":"100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:20:25.288961Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2505.19293"},"observation_digest":"sha256:35d0489fd7646fd09c64afaa2876cfffab073b4e6aa42312f212a0833c0bb03a","observation_id":"7b19a446-827a-4ff6-87aa-f8fe4cbc08b9","resolution":{"observed_at":"2026-08-07T14:20:25.288961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T11:17:36.333821Z","title":"Sequence paral- lelism: Long sequence training from system perspective.arXiv preprint arXiv:2105.13120, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-08T08:52:04.200826Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.333821Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:8d51ba48ad2f35e62440646abf1984dc32a2958b7dcbdf5e73b4d01527f8dea1","observation_id":"8316e377-e9ca-4bba-99fc-99db6a301f91","resolution":{"observed_at":"2026-08-07T11:17:36.333821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T10:28:32.085563Z","title":"Sequence paral- lelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05343","last_updated":"2025-06-11T15:48:38Z","snapshot_observed_at":"2026-08-09T14:23:10.699088Z","submitted_at":"2025-06-05T17:59:54Z","title":"ContentV: Efficient Training of Video Generation Models with Limited Compute","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:32.085563Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.05343"},"observation_digest":"sha256:d12e1f876c152a583416348a5cf383b3f5d29c9b446fd4c4f84820fceff7ae50","observation_id":"aa75cc33-de9a-4262-beba-b1b0be105839","resolution":{"observed_at":"2026-08-07T10:28:32.085563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T06:02:32.922834Z","title":"Sequence parallelism: Making 4d parallelism possible","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-07T21:55:43.371585Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:32.922834Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.06122"},"observation_digest":"sha256:4e0dd02c6d4b388f1171809a1f2bddba2fd95046392b470d43cac9cfa9d7f725","observation_id":"4397b7e9-5a51-4462-97ae-4f0f935b4ab0","resolution":{"observed_at":"2026-08-07T06:02:32.922834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T00:30:57.105856Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-09T05:07:40.565767Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.105856Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:36f4dddce76504e29d784a2e86490501288358a6289168cbebef5d01b4fa714d","observation_id":"9786b61f-a944-441d-8011-a71f08b31f5f","resolution":{"observed_at":"2026-08-07T00:30:57.105856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-06T23:11:08.905826Z","title":"Sequence parallelism: Long sequence training from system perspective.arXiv preprint arXiv:2105.13120,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19290","last_updated":"2025-06-24T03:53:36Z","snapshot_observed_at":"2026-08-09T21:24:15.552941Z","submitted_at":"2025-06-24T03:53:36Z","title":"Skywork-SWE: Unveiling Data Scaling Laws for Software Engineering in LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:08.905826Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.19290"},"observation_digest":"sha256:630fb8c197f096a81c3f80399694661e076d4914d2176fa95fb38817367f3918","observation_id":"b5dd0957-cac0-43ba-8316-4e8de9778731","resolution":{"observed_at":"2026-08-06T23:11:08.905826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-05T17:55:11.234042Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:11.234042Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:f04a725fdd476f9dff4675d7dd66cf962731011b6d2460f95543f3815062ddb0","observation_id":"dc945350-74c7-40d7-a7fe-22216310527c","resolution":{"observed_at":"2026-08-05T17:55:11.234042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-05T13:52:28.794986Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00217","last_updated":"2025-08-29T20:01:35Z","snapshot_observed_at":"2026-08-08T23:54:20.135229Z","submitted_at":"2025-08-29T20:01:35Z","title":"Learning to Shard: RL for Co-optimizing the Parallelism Degrees and Per-operator Sharding Dimensions in Distributed LLM Inference","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T13:52:28.794986Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2509.00217"},"observation_digest":"sha256:2a0918bff38375e980a38bb87a56249704557abfe84973e59067a57c7e8324f5","observation_id":"5b76fa2b-c631-4d1f-91e3-164d2e7593a7","resolution":{"observed_at":"2026-08-05T13:52:28.794986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-04T12:55:10.837066Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.01565","last_updated":"2026-06-18T01:08:24Z","snapshot_observed_at":"2026-08-10T05:37:30.922463Z","submitted_at":"2025-10-02T01:23:32Z","title":"TetriServe: Efficiently Serving Mixed DiT Workloads","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:10.837066Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2510.01565"},"observation_digest":"sha256:fb30ce26102c1b93f7c3f2da182f505cd4414eb62d09c501ace0e8c2d64f2a10","observation_id":"547516d7-5037-43eb-a675-17713898ed44","resolution":{"observed_at":"2026-08-04T12:55:10.837066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-02T21:11:50.032377Z","title":"Sequence parallelism: Long sequence training from system perspective, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T04:28:00.132124Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.032377Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:55bbe86ff257ff574a031b458ae40282c31bd781cbaa97f4c796a86c66165815","observation_id":"0a064b01-f126-40e6-bf92-a8c2d30f1b24","resolution":{"observed_at":"2026-08-02T21:11:50.032377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2605.05628","last_updated":"2026-05-07T03:29:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T03:29:51Z","title":"Towards Compute-Aware In-Switch Computing for LLMs Tensor-Parallelism on Multi-GPU Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T04:41:03.457680Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2605.05628"},"observation_digest":"sha256:97ef2f13f05eaab9fcf9242ccf313ac4307136b8f7eb172ee12c5bf6f2e73a89","observation_id":"02222285-4611-4fc1-8a99-ed855fe0cc04","resolution":{"observed_at":"2026-05-11T21:41:14.135198Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2605.17164","last_updated":"2026-05-19T23:51:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-16T21:28:22Z","title":"Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T08:55:31.298030Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2605.17164"},"observation_digest":"sha256:8c17fb43fb4735b50ef62c370a5167310496981b1cc718e5e177f95be73ebdd2","observation_id":"a43b33c6-db05-495b-975a-439585037437","resolution":{"observed_at":"2026-05-21T08:59:55.770043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2605.18710","last_updated":"2026-05-18T17:44:29Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:44:29Z","title":"Mosaic: Towards Efficient Training of Multimodal Models with Spatial Resource Multiplexing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T07:53:11.761843Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2605.18710"},"observation_digest":"sha256:61cbddd96cbeaa565c0aa9284ed6718a40861e765b43a12f56cdd81eb08f97d8","observation_id":"442c23a1-c1ce-4b8c-b020-79353d910f77","resolution":{"observed_at":"2026-05-20T07:53:24.750202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2606.19989","last_updated":"2026-06-18T09:29:28Z","snapshot_observed_at":"2026-08-02T02:03:02.388345Z","submitted_at":"2026-06-18T09:29:28Z","title":"Online Dynamic Batching with Formal Guarantees for LLM Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T15:57:18.544274Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2606.19989"},"observation_digest":"sha256:494b0bbda0fb2bafdb94a7bd8c369f1ee1f685d342d98c27e558ffa9b7335951","observation_id":"9525b37c-6ba3-41ad-81f2-6b08c1687abc","resolution":{"observed_at":"2026-07-04T05:29:35.935578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2606.22541","last_updated":"2026-06-21T14:57:45Z","snapshot_observed_at":"2026-08-05T19:10:35.929740Z","submitted_at":"2026-06-21T14:57:45Z","title":"ASAP: A Disaggregated and Asynchronous Inference System for MoE Prefill","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T09:42:39.573568Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2606.22541"},"observation_digest":"sha256:19846ce7dbe82f5dd79116872c90578aa495e89c6f21baf8bc316efe9ce3d091","observation_id":"a02cb5f7-b5af-431a-a4ad-2b877e49476e","resolution":{"observed_at":"2026-07-04T09:39:46.807624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2607.01646","last_updated":"2026-07-06T23:06:49Z","snapshot_observed_at":"2026-08-08T05:43:18.001820Z","submitted_at":"2026-07-02T03:17:58Z","title":"PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-03T17:26:07.870260Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.01646"},"observation_digest":"sha256:660682d189b041070780c6aeddc6fd721bbda86e471e7aa5dd96fbea1c0e0d95","observation_id":"69a5c0ea-6441-4a69-8384-16c246a3f958","resolution":{"observed_at":"2026-07-03T17:28:43.956670Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-12T08:40:29.554554Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.01646","last_updated":"2026-07-06T23:06:49Z","snapshot_observed_at":"2026-08-08T05:43:18.001820Z","submitted_at":"2026-07-02T03:17:58Z","title":"PHOENIX: Resilient LLM Training with Hot-Swapping via Zero-Overhead Checkpoint","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T08:40:29.554554Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.01646"},"observation_digest":"sha256:6decb35a35717f67ac8ed7722e564b55caacce4583aa342e1ee4502ff02bb140","observation_id":"a648ba3b-41c3-4a22-b4a4-38b97f72cd32","resolution":{"observed_at":"2026-07-12T08:40:29.554554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":"2105.13120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-04T09:39:46.806179Z","title":"arXiv preprint arXiv:2105.13120 , year=","venue":null,"work_id":"ed001793-ff39-4794-be7b-212c2a1f4de1","year":2022},"citing_paper":{"arxiv_id":"2607.01817","last_updated":"2026-07-02T07:30:53Z","snapshot_observed_at":"2026-08-08T01:33:34.083325Z","submitted_at":"2026-07-02T07:30:53Z","title":"HCMS: Head-Chunked Multi-Stream Pipeline for Communication-Computation Overlap in Long-Sequence Parallel Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-03T06:22:23.985308Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.01817"},"observation_digest":"sha256:d65b451e369f367e387245cf898bf9a986f7aa13b6865e64dacbc65b9feda298","observation_id":"f8b4783f-dd2b-4cb4-8f77-fd28935a3bad","resolution":{"observed_at":"2026-07-03T06:27:41.863772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-07-12T02:29:52.764344Z","title":"Sequence","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05439","last_updated":"2026-07-03T15:50:24Z","snapshot_observed_at":"2026-07-12T02:29:47.974846Z","submitted_at":"2026-07-03T15:50:24Z","title":"Design-CP: Context Parallelism for Design of Protein Nanoparticles","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-12T02:29:52.764344Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.05439"},"observation_digest":"sha256:92de6d40a42da3d4b03c1c7e0b4ef9bd5f0c1d3ea692ab80da31d5cbdea8ca02","observation_id":"6712b88c-b529-44d7-87b3-51e4c5d5f696","resolution":{"observed_at":"2026-07-12T02:29:52.764344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-01T20:54:14.069087Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16488","last_updated":"2026-07-17T20:27:26Z","snapshot_observed_at":"2026-08-07T14:52:50.399447Z","submitted_at":"2026-07-17T20:27:26Z","title":"Auto-Scaling Heterogeneous Neural Processing Units for Energy and Cost-Efficient LLM Serving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T20:54:14.069087Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2607.16488"},"observation_digest":"sha256:ff615f7b4391099a97fc0434d6ffff0d4341e01d0776e9c7601d9b45c69133a9","observation_id":"ad4c00d3-51d0-48fa-ab5b-91bdf8133d7a","resolution":{"observed_at":"2026-08-01T20:54:14.069087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2105.13120/citation-record","integrity":"/paper/2105.13120/integrity","json":"/paper/2105.13120/citation-record.json","paper":"/paper/2105.13120"},"outbound":[],"paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:48:10.415434Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2105.13120."}