{"as_of":"2026-08-19T23:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fff82f0602c21c5105df812cd91bcef636b0472c933575d883231a373eae13ee","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:30:57.837571Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:11:48.095184Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13996","snapshot_observed_at":"2026-08-02T21:11:48.095184Z","title":"Arctic long sequence training: Scalable and efficient training for multi-million token sequences, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.21196","last_updated":"2026-07-10T12:36:34Z","snapshot_observed_at":"2026-08-16T06:41:42.720292Z","submitted_at":"2026-02-24T18:54:39Z","title":"Untied Ulysses: Memory-Efficient Context Parallelism via Headwise Chunking","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T21:11:48.095184Z"},"links":{"cited_paper":"/paper/2506.13996","citing_paper":"/paper/2602.21196"},"observation_digest":"sha256:4abba694c1f1e490e68dfbd2fcfaa61e8475e165eee6c66470b714e2fb5cb258","observation_id":"f68b75ca-1d76-4926-b339-af583cf09ac8","resolution":{"observed_at":"2026-08-02T21:11:48.095184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13996/citation-record","integrity":"/paper/2506.13996/integrity","json":"/paper/2506.13996/citation-record.json","paper":"/paper/2506.13996"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T00:30:56.473062Z","title":"Ring attention with blockwise transformers for near-infinite context,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:56.473062Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:14243799c72f3df039c9678f57b896729fa375d3572ef0339954fb63edf2931b","observation_id":"40367eda-1cf8-4460-8d22-17d7ec9af6c2","resolution":{"observed_at":"2026-08-07T00:30:56.473062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-13T22:49:56.824755Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T00:30:56.703220Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:56.703220Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:e22e0516d0a3ea5f34bd017c079f762d4d2704ab3f5ed762a619ae00a57f63d6","observation_id":"97957d92-9f4b-4298-bd7f-1b37b5bb3d3a","resolution":{"observed_at":"2026-08-07T00:30:56.703220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05198","last_updated":"2022-05-10T22:40:17Z","snapshot_observed_at":"2026-08-19T01:36:16.251515Z","submitted_at":"2022-05-10T22:40:17Z","title":"Reducing Activation Recomputation in Large Transformer Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05198","snapshot_observed_at":"2026-08-07T00:30:56.938309Z","title":"Reducing activation recomputation in large transformer models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:56.938309Z"},"links":{"cited_paper":"/paper/2205.05198","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:73cca6a51af1685ed7f389c896dfe3e86653e7cc2dde76564a7c71ade3e244a0","observation_id":"05cf9cdb-0e18-47b3-8b67-145d5b4307f4","resolution":{"observed_at":"2026-08-07T00:30:56.938309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-16T18:22:05.145735Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-07T00:30:57.105856Z","title":"Sequence parallelism: Long sequence training from system perspective,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.105856Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:eaabb84546486f06d4124f376851537f93e2f8de58a3bc6204b5d6215287f58a","observation_id":"9786b61f-a944-441d-8011-a71f08b31f5f","resolution":{"observed_at":"2026-08-07T00:30:57.105856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03294","last_updated":"2024-03-31T21:11:08Z","snapshot_observed_at":"2026-08-16T14:54:55.175376Z","submitted_at":"2023-10-05T03:47:57Z","title":"DISTFLASHATTN: Distributed Memory-efficient Attention for Long-context LLMs Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03294","snapshot_observed_at":"2026-08-07T00:30:57.230466Z","title":"Distflashattn: Distributed memory-efficient attention for long-context llms training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.230466Z"},"links":{"cited_paper":"/paper/2310.03294","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:fee9ea0de13be69811659cd60e345e65dfa6a7538cbda7dd4545b376eb1b111c","observation_id":"c4684dc0-5dd9-423f-b97d-1dde205943c9","resolution":{"observed_at":"2026-08-07T00:30:57.230466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-07T00:30:57.281690Z","title":"Striped attention: Faster ring attention for causal transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.281690Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:610fdd3c72b4cc323d02668d3fc9d67d0c9c54f2866fdb594d29ed85d1af079e","observation_id":"4cf2c8ee-c34e-4f71-a054-6050612b2b61","resolution":{"observed_at":"2026-08-07T00:30:57.281690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-07T00:30:57.362359Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.362359Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:e8febd6ca6340900753ebf81d79cfcd66db4e37836af6c1af300170150e24bc1","observation_id":"9d9e0298-ab80-4bb6-8aba-7eadca48f60d","resolution":{"observed_at":"2026-08-07T00:30:57.362359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-08-16T13:53:11.380164Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-07T00:30:57.510416Z","title":"Usp: A unified sequence parallelism approach for long context generative ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.510416Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:85bb219b41bbd4104f6bff71679f99c79fa82dde34dc2fa170701e9611f1bede","observation_id":"3d33a8a5-0944-4486-9b2e-f980395fd95f","resolution":{"observed_at":"2026-08-07T00:30:57.510416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18485","last_updated":"2024-06-26T16:51:28Z","snapshot_observed_at":"2026-08-17T09:01:40.308743Z","submitted_at":"2024-06-26T16:51:28Z","title":"LoongTrain: Efficient Training of Long-Sequence LLMs with Head-Context Parallelism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18485","snapshot_observed_at":"2026-08-07T00:30:57.602093Z","title":"Loongtrain: Efficient training of long-sequence llms with head-context parallelism,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.602093Z"},"links":{"cited_paper":"/paper/2406.18485","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:8143af441dbdba4930127f053814b749f77050a2437c394fbf0db31e8858882f","observation_id":"56cbb9a8-b30c-4123-8fb3-a696124d50ce","resolution":{"observed_at":"2026-08-07T00:30:57.602093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10989","last_updated":"2025-01-24T00:14:55Z","snapshot_observed_at":"2026-08-16T13:09:27.656495Z","submitted_at":"2024-10-14T18:17:01Z","title":"Liger Kernel: Efficient Triton Kernels for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10989","snapshot_observed_at":"2026-08-07T00:30:57.663570Z","title":"Liger kernel: Efficient triton kernels for llm training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.663570Z"},"links":{"cited_paper":"/paper/2410.10989","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:8833aee7da3126ee6c68833e617ef3cf728397bfbcc8f1ae2ad09ea431e9b84c","observation_id":"6ba52778-8e90-491f-a35d-e8bedcd57bde","resolution":{"observed_at":"2026-08-07T00:30:57.663570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:30:58.261343Z","title":"Datasets: A community library for natural language processing,","venue":null,"work_id":"0da76f72-97dd-4d0e-b207-272cc6633bb3","year":2021},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.742706Z"},"links":{"citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:07c0517c2243fae77320007da35f6762fe4cc5e4c17c57db32c3aeee7ba085a2","observation_id":"dd1ff85e-5006-4493-ac35-44d4b275336f","resolution":{"observed_at":"2026-08-07T00:30:58.266013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:30:58.244659Z","title":"ArcticTraining: Simplifying and accelerating post-training for large language models,","venue":null,"work_id":"2b67dd33-80b8-42c6-bfee-13d1daec5254","year":2025},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.748571Z"},"links":{"citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:384894d36f52f7118a25010181512e4233409d085ccfda802d5e303dd4236579","observation_id":"fd638e83-7865-4f24-b9b6-1e00006d7cc6","resolution":{"observed_at":"2026-08-07T00:30:58.250240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:30:57.786155Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.786155Z"},"links":{"citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:83982c4f245363a077de5d6bd3df09dfd0be4ae4e1beb66d69be563f25258b0b","observation_id":"622566c1-dd5c-448b-9a97-c4efac6fe13b","resolution":{"observed_at":"2026-08-07T00:30:57.786155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:30:58.221001Z","title":"Transformers: State-of-the-art natural language processing,","venue":null,"work_id":"1425d405-7667-40c9-ae04-374a062d7721","year":2020},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.805996Z"},"links":{"citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:c921cdc0e9de51c833bb7776369b98e917b52099dcae5932d2606b750ab77d78","observation_id":"ca5d832f-b92b-41ae-a63e-3db5732e2929","resolution":{"observed_at":"2026-08-07T00:30:58.233466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-07T00:30:57.822249Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.822249Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:1226ad0cba932a0bf72641000bb302091aad9b8d4de2d0bf60813321f7a5cb61","observation_id":"26203125-424d-4dc8-ac48-05c8314a0a3d","resolution":{"observed_at":"2026-08-07T00:30:57.822249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05100","last_updated":"2023-06-27T09:57:58Z","snapshot_observed_at":"2026-08-04T18:56:03.233715Z","submitted_at":"2022-11-09T18:48:09Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05100","snapshot_observed_at":"2026-08-07T00:30:57.832992Z","title":"Bloom: A 176b-parameter open-access multilingual language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.832992Z"},"links":{"cited_paper":"/paper/2211.05100","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:183450abf5a2037cc6b9dbc33e97d15ea59d79d7bd26ea19479eace4090171ed","observation_id":"19ccebd1-f9c0-45b0-91fe-236b9f080d5e","resolution":{"observed_at":"2026-08-07T00:30:57.832992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14489","last_updated":"2024-01-30T21:26:09Z","snapshot_observed_at":"2026-08-17T18:00:47.098181Z","submitted_at":"2024-01-25T19:50:31Z","title":"The Case for Co-Designing Model Architectures with Hardware","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14489","snapshot_observed_at":"2026-08-07T00:30:57.837571Z","title":"The case for co-designing model architectures with hardware,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:30:57.837571Z"},"links":{"cited_paper":"/paper/2401.14489","citing_paper":"/paper/2506.13996"},"observation_digest":"sha256:ae84de5a9f26d5cb8ed3d5424a0efaeb9b4d3117439de82fbcf0c14c04090a6f","observation_id":"b8d73282-b716-4528-85b6-a516858600f3","resolution":{"observed_at":"2026-08-07T00:30:57.837571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13996","last_updated":"2025-06-16T20:52:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T00:17:32.497393Z","submitted_at":"2025-06-16T20:52:28Z","title":"Arctic Long Sequence Training: Scalable And Efficient Training For Multi-Million Token Sequences"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2506.13996."}