{"as_of":"2026-08-11T14:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:917e190dade22c37aa6066f777b3eb80b9ecfcb295cecfa2de3ad3213960c4d8","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:11:51.292724Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.21196/citation-record","integrity":"/paper/2602.21196/integrity","json":"/paper/2602.21196/citation-record.json","paper":"/paper/2602.21196"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:11:47.906779Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:47.906779Z"},"links":{"citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:48ce2a41bb9dbcc918983c2d5ace9e906800fc7442c1bc694f07c29f1c90d68b","observation_id":"c99560fe-254d-461e-b429-c9517ab8539e","resolution":{"observed_at":"2026-08-02T21:11:47.906779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-02T21:11:48.019583Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.019583Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:92658144e069f6acc78acc82f7c9d63abd3cd4a0d2786f736a9b78cbf6c39336","observation_id":"6b7a624e-99ee-42be-84d2-49e96250f034","resolution":{"observed_at":"2026-08-02T21:11:48.019583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-10T08:47:24.078313Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13996","snapshot_observed_at":"2026-08-02T21:11:48.095184Z","title":"Arctic long sequence training: Scalable and efficient training for multi-million token sequences, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.095184Z"},"links":{"cited_paper":"/paper/2506.13996","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:d27a4aaa20a0ad1cda57a823f605f7513566d07575a2dc158c6d3f273b481d57","observation_id":"f68b75ca-1d76-4926-b339-af583cf09ac8","resolution":{"observed_at":"2026-08-02T21:11:48.095184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-11T09:20:49.392094Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-02T21:11:48.153620Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.153620Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:19b7e6a7ab91c81cacfa3cdab7a4e87ceee1955970466339dedb89b5899e2810","observation_id":"afd8f254-9ddd-4193-9ac6-e7ee3efeba62","resolution":{"observed_at":"2026-08-02T21:11:48.153620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06176","last_updated":"2024-11-09T13:30:38Z","snapshot_observed_at":"2026-07-06T19:47:51.117687Z","submitted_at":"2024-11-09T13:30:38Z","title":"M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06176","snapshot_observed_at":"2026-08-02T21:11:48.243215Z","title":"K., Cheng, L., Chan, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.243215Z"},"links":{"cited_paper":"/paper/2411.06176","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:7f592a1efcbe807a9b41b745e46d7dc7ebd92c5033674b07d272d3ca04c2c12b","observation_id":"96885c7e-b90e-4767-8fde-157aae7cddaa","resolution":{"observed_at":"2026-08-02T21:11:48.243215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:11:48.328966Z","title":"Y., Ermon, S., Rudra, A., and R \\'e , C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.328966Z"},"links":{"citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:29f5552dbc95d78899d1c664fa9f338156f04c03279ec51acc68555cc99d2e10","observation_id":"a1e2d119-88ba-4606-bd02-3953d6af281a","resolution":{"observed_at":"2026-08-02T21:11:48.328966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-07-06T18:13:29.693360Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-02T21:11:48.416657Z","title":"and Zhao, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.416657Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:ff9e918aac852675c9dc1f6bcfe0f30f91b7479a980820d76c14d649aed3d841","observation_id":"8cda7e97-6288-4297-9187-bcb71248e09d","resolution":{"observed_at":"2026-08-02T21:11:48.416657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:11:48.587505Z","title":"Gemini 3.0: A new era of intelligence with gemini 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.587505Z"},"links":{"citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:6edf9f6ad831ecd34c516dc8a463d62bdcc7198b3c5b473b1d07354b40559a02","observation_id":"e1f768da-03cd-436e-8b4a-4fb7ae1a4679","resolution":{"observed_at":"2026-08-02T21:11:48.587505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T21:11:48.708496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.708496Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:b08cae3304e085f9de14ef569508821056a6e1d8287d552e740a4371507b9b58","observation_id":"55cd6d9f-3cba-42f5-8de9-4db081f938f5","resolution":{"observed_at":"2026-08-02T21:11:48.708496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:11:48.861211Z","title":"Unsloth, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.861211Z"},"links":{"citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:42c1d6ab369a793fdba90257ed77ad8235f19890736106ca1f805cfa193a1217","observation_id":"3b8a64e6-f660-40a4-99ac-8949748bea35","resolution":{"observed_at":"2026-08-02T21:11:48.861211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09426","last_updated":"2021-04-19T16:18:00Z","snapshot_observed_at":"2026-08-06T05:11:45.971850Z","submitted_at":"2021-04-19T16:18:00Z","title":"Advanced Long-context End-to-end Speech Recognition Using Context-expanded Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09426","snapshot_observed_at":"2026-08-02T21:11:48.953565Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.953565Z"},"links":{"cited_paper":"/paper/2104.09426","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:3857faf1c5442f1362f38cfc816eee997bb90185d8fb06a2e9b2e19b1f0ac1bc","observation_id":"2dcfedae-0636-4195-a19d-59acb3f1eb3f","resolution":{"observed_at":"2026-08-02T21:11:48.953565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:11:49.060784Z","title":"Liger-kernel: Efficient triton kernels for LLM training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.060784Z"},"links":{"citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:fae70872ef958a3d8d7bd13eef6cb87759d2bfb0f0ef5f19a5e241af67f8219e","observation_id":"4190dcf3-bdb3-4e09-a596-5bd0f0cdfc3c","resolution":{"observed_at":"2026-08-02T21:11:49.060784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-02T21:11:49.195785Z","title":"Qwen2.5-coder technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.195785Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:3e8e0420f8d3ce2e00c071c3f8492afc0d329e1469ec2aed0c57a62008c87eef","observation_id":"001bd1f1-5071-4097-8ae6-d3ae4e2eaf8c","resolution":{"observed_at":"2026-08-02T21:11:49.195785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-02T21:11:49.350958Z","title":"A., Tanaka, M., Zhang, C., Zhang, M., Song, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.350958Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:0cca27fde29fd64bbb359f3bea176371e197695fb287f3b13a9870381b739555","observation_id":"ea053d39-524b-43bb-b29e-3471a748a529","resolution":{"observed_at":"2026-08-02T21:11:49.350958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-02T21:11:49.493389Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.493389Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:81b38091429ba035563f93bcc55d300f8d979155f0a2b059b46a8798ba23e50b","observation_id":"c96becb5-636f-4967-96d9-4265da21b165","resolution":{"observed_at":"2026-08-02T21:11:49.493389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15319","last_updated":"2024-09-01T17:21:18Z","snapshot_observed_at":"2026-08-10T13:24:40.742339Z","submitted_at":"2024-06-21T17:23:21Z","title":"LongRAG: Enhancing Retrieval-Augmented Generation with Long-context LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15319","snapshot_observed_at":"2026-08-02T21:11:49.632698Z","title":"Longrag: Enhancing retrieval-augmented generation with long-context llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.632698Z"},"links":{"cited_paper":"/paper/2406.15319","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:8d8bb100e18c484707f9c9b62541984c015468d319c8366a6cd2a0c4b3b9eb53","observation_id":"25749982-9c90-41c1-a6d2-5bdb6013d582","resolution":{"observed_at":"2026-08-02T21:11:49.632698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-02T21:11:49.698578Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.698578Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:19acdb88cd970a0ba98d2be6fd46221406ce5add5c9b238f9ca7615b93748b85","observation_id":"8edc2120-d570-4a4a-8b49-e52572cbe760","resolution":{"observed_at":"2026-08-02T21:11:49.698578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-08-10T09:51:23.811238Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-02T21:11:49.812534Z","title":"Reducing activation recomputation in large transformer models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.812534Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:9182167b1b40cb003e3952decc7d0e06ab21ec9e4bc029af231ec8eb6354a573","observation_id":"25597e34-7a25-4688-a37f-d0c9ac86d4fa","resolution":{"observed_at":"2026-08-02T21:11:49.812534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-02T21:11:49.946228Z","title":"B., Zi, Y., Muennighoff, N., Kocetkov, D., Mou, C., Marone, M., Akiki, C., Li, J., Chim, J., Liu, Q., Zheltonozhskii, E., Zhuo, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:49.946228Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:dfcdab13fb6cd4fe6254c42300a3123d6b0cbcb3174369723296d97e90622238","observation_id":"5563856c-5726-4244-98e2-77337331e676","resolution":{"observed_at":"2026-08-02T21:11:49.946228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-10T10:23:27.892451Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-02T21:11:50.032377Z","title":"Sequence parallelism: Long sequence training from system perspective, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.032377Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:a3002a7d9ff901c73ba5401e7c3493767595bc289fa2564c4f893b6232146442","observation_id":"0a064b01-f126-40e6-bf92-a8c2d30f1b24","resolution":{"observed_at":"2026-08-02T21:11:50.032377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:11:50.141072Z","title":"Sequence parallelism: Long sequence training from system perspective","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.141072Z"},"links":{"citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:419ed3d4c90df9b947921881ffb8859b621fde13cdf3890569b423ed4abeff0f","observation_id":"67abdf03-4eaa-42b9-a064-545937294de6","resolution":{"observed_at":"2026-08-02T21:11:50.141072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:11:50.244468Z","title":"Torchtitan: One-stop pytorch native solution for production ready LLM pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.244468Z"},"links":{"citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:53585db15f88728a07a84ce19e82f7e672d672315a7cfd29a1c36c29eade7973","observation_id":"eee07d3f-0a17-4640-afd9-3d4765fae34e","resolution":{"observed_at":"2026-08-02T21:11:50.244468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-02T21:11:50.310017Z","title":"Ring attention with blockwise transformers for near-infinite context, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.310017Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:8cc45a11296e3c766fb44834bc8979b7e7f947088fdd522573b6521f8ff39f5d","observation_id":"2082e951-a090-4af2-8b19-a5badeed4f86","resolution":{"observed_at":"2026-08-02T21:11:50.310017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-02T21:11:50.391061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.391061Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:b8bc21ee45526ee1a8e872f06ff5004a7e596ad73abdcbc3d96d669474154b30","observation_id":"f50b51a8-d40d-4473-ad95-6f265343e380","resolution":{"observed_at":"2026-08-02T21:11:50.391061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-02T21:11:50.475375Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.475375Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:5d44f56288cc62866e5f4baa1c365500a9430b454d8a576e87021c42171efb90","observation_id":"a9875024-4b17-4f39-b112-889bd3585726","resolution":{"observed_at":"2026-08-02T21:11:50.475375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-02T21:11:50.563806Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.563806Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:bbdb63748099dde52616ed071ee8dd5e994e4db5e265b397b952b3f0d5636596","observation_id":"fb5aa8ca-ed68-452b-8ff0-a1db0ab6c9c8","resolution":{"observed_at":"2026-08-02T21:11:50.563806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T21:11:50.645700Z","title":"Wan: Open and advanced large-scale video generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.645700Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:68cd35ad418f436330ffd463756a63dc05fe1389ce84eff8c48222ea89407e45","observation_id":"c3ff2873-f83a-469e-ade1-6898833286c3","resolution":{"observed_at":"2026-08-02T21:11:50.645700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:11:50.774863Z","title":"N., Kaiser, L., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.774863Z"},"links":{"citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:1554833f664278ce1c60ddec8531abceacb3f6491f2243e683ff7981ca13f963","observation_id":"6f46242a-be0f-4f88-a349-e6cf3f157d53","resolution":{"observed_at":"2026-08-02T21:11:50.774863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-08-02T21:11:50.925574Z","title":"Hunyuanvideo 1.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:50.925574Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:75eeacd52879dc0e66ef0282398fba7a4c7cdeec027b32a2f7e37dc5bdf40efe","observation_id":"83960181-6e2b-4ede-8d1f-f2233a667b44","resolution":{"observed_at":"2026-08-02T21:11:50.925574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T21:11:51.044030Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:51.044030Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:6a4cd259ed7452d4a6c5ca105e7e5a6b26cf163b59d33be7db70560dd2caa7a6","observation_id":"7cb410f2-0c61-40f6-b4b6-97a6acbd66e3","resolution":{"observed_at":"2026-08-02T21:11:51.044030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02328","last_updated":"2024-06-14T16:04:48Z","snapshot_observed_at":"2026-08-11T01:54:00.233091Z","submitted_at":"2024-06-04T13:58:28Z","title":"SimpleSpeech: Towards Simple and Efficient Text-to-Speech with Scalar Latent Transformer Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02328","snapshot_observed_at":"2026-08-02T21:11:51.164939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:51.164939Z"},"links":{"cited_paper":"/paper/2406.02328","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:fabb3af8adda600a430fe2a28b7f6c6bfe3deac3fd219ad26c14322030e1c961","observation_id":"b78d2d07-028f-4631-9aff-1f837a23dda8","resolution":{"observed_at":"2026-08-02T21:11:51.164939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16978","last_updated":"2025-05-13T15:07:26Z","snapshot_observed_at":"2026-08-06T02:53:01.490402Z","submitted_at":"2024-08-30T02:44:26Z","title":"Training Ultra Long Context Language Model with Fully Pipelined Distributed Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16978","snapshot_observed_at":"2026-08-02T21:11:51.253437Z","title":"A., Tanaka, M., Ruwase, O., Subramoni, H., and Panda, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:51.253437Z"},"links":{"cited_paper":"/paper/2408.16978","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:4dcdb8ed88068578165db0f3b0a36d595d0c363f55af9044cb86695fb966fd41","observation_id":"f7629dfe-3273-4b4e-95e1-5320c0571101","resolution":{"observed_at":"2026-08-02T21:11:51.253437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-02T21:11:51.292724Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:51.292724Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:f40438552ee555215a3651779e84f30a26400eeaf086a6735286cf35d5d273d3","observation_id":"f4cfafaf-795e-49b0-bafe-c0b38fc668cf","resolution":{"observed_at":"2026-08-02T21:11:51.292724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T08:47:24.615042Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2602.21196."}