{"as_of":"2026-08-22T14:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6899c31c504ed587221dec4f11c2acd12710cf475c23f2e88a22b119352e7606","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:30:57.861433Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:52:30.402478Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:55:24.657761Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"cited_work":{"arxiv_id":"2601.16956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.16956","snapshot_observed_at":"2026-06-29T01:14:28.007359Z","title":"Maurya, M","venue":null,"work_id":"4cbfc9e3-c257-4f34-8924-e265ac8c816a","year":2026},"citing_paper":{"arxiv_id":"2605.11215","last_updated":"2026-05-22T00:14:51Z","snapshot_observed_at":"2026-08-13T01:03:20.344326Z","submitted_at":"2026-05-11T20:28:31Z","title":"ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:59:28.408860Z"},"links":{"cited_paper":"/paper/2601.16956","citing_paper":"/paper/2605.11215"},"observation_digest":"sha256:6f364fc8ebc385b1ebd27f3b641c1806ee951404385d505f106eb549d4b30167","observation_id":"62c009ef-6082-45fa-b036-27c0b91d5df8","resolution":{"observed_at":"2026-06-29T01:14:28.007359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"cited_work":{"arxiv_id":"2601.16956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.16956","snapshot_observed_at":"2026-06-29T01:14:28.007359Z","title":"Maurya, M","venue":null,"work_id":"4cbfc9e3-c257-4f34-8924-e265ac8c816a","year":2026},"citing_paper":{"arxiv_id":"2605.11215","last_updated":"2026-05-22T00:14:51Z","snapshot_observed_at":"2026-08-13T01:03:20.344326Z","submitted_at":"2026-05-11T20:28:31Z","title":"ReCoVer: Resilient LLM Pre-Training System via Fault-Tolerant Collective and Versatile Workload","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T05:52:30.402478Z"},"links":{"cited_paper":"/paper/2601.16956","citing_paper":"/paper/2605.11215"},"observation_digest":"sha256:9eb5bcb912ba15663530352dd1dc176757aee3ea6c25e35a30cbf689fca7d72c","observation_id":"16ac29bb-b626-4a74-95e5-39a9cdfd2880","resolution":{"observed_at":"2026-06-29T01:14:28.007359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.16956/citation-record","integrity":"/paper/2601.16956/integrity","json":"/paper/2601.16956/citation-record.json","paper":"/paper/2601.16956"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18864","snapshot_observed_at":"2026-08-03T08:30:55.044625Z","title":"Towards an ai co-scientist,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.044625Z"},"links":{"cited_paper":"/paper/2502.18864","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:38887f922af0be7b78d139818e78720d8998aa21487539c9ebb390869f1ae5af","observation_id":"d605c9a5-7744-434a-be3f-d4ee79ae7a19","resolution":{"observed_at":"2026-08-03T08:30:55.044625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.125489Z","title":"Scaling llama 3 training with efficient parallelism strategies,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.125489Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:e70870a6d7ebfd5615ce7cb75e8b7fd54e51c14c8b0a795221bd387c465f8e87","observation_id":"408b28a6-ed92-4010-a027-ecea474b4c25","resolution":{"observed_at":"2026-08-03T08:30:55.125489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.200566Z","title":"BLOOM: A 176B-Parameter Open-Access Multilingual Language Model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.200566Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:679f24ff113d2965d31b3ffd496b30e479f302d4c6f53b96f6b1014642023289","observation_id":"84f44455-5f6d-4334-9f65-ed77f287944e","resolution":{"observed_at":"2026-08-03T08:30:55.200566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.281621Z","title":"DeepSpeed: System Optimizations Enable Training Deep Learning Models with Over 100 Billion Parameters,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.281621Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:d46daaacb284115b7eb6eda3790877b561d4ff5996d80b1707383f47c1676d85","observation_id":"a5a9ef2c-86dc-4768-b88c-c86f9ba68e29","resolution":{"observed_at":"2026-08-03T08:30:55.281621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-03T08:30:55.350781Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.350781Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:1837c77f5311cb6ce36b194391b31f6477d735102f39b316049b09b2f8b14b2b","observation_id":"92d54919-66cd-4825-a8e5-b7a6181c66e8","resolution":{"observed_at":"2026-08-03T08:30:55.350781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.395602Z","title":"Robust llm training infrastructure at bytedance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.395602Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:6a0e16e803643c1af59b2cd068f27385266b8f9099c33bdd768430ba05a543e8","observation_id":"3fa05e02-df14-4849-bd47-c134ef97c201","resolution":{"observed_at":"2026-08-03T08:30:55.395602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.469818Z","title":"Unicron: Economizing self-healing llm training at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.469818Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:51bb2c0684767834a3cae5cea6bbc4f44e64b7c37559136d9a64db9464115071","observation_id":"b2aed746-885f-4953-a74d-4220c88282ac","resolution":{"observed_at":"2026-08-03T08:30:55.469818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16903","last_updated":"2025-07-25T05:09:17Z","snapshot_observed_at":"2026-08-21T01:26:22.380547Z","submitted_at":"2023-12-28T08:53:27Z","title":"Spike No More: Stabilizing the Pre-training of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16903","snapshot_observed_at":"2026-08-03T08:30:55.527546Z","title":"Spike no more: Stabilizing the pre-training of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.527546Z"},"links":{"cited_paper":"/paper/2312.16903","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:da06078c79743b912dff929e34f8e07bcfa79a305c23a782daab4c5ed1f0d782","observation_id":"c63a0b42-d534-471a-9761-203a00acd1b7","resolution":{"observed_at":"2026-08-03T08:30:55.527546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13768","last_updated":"2024-06-19T18:31:23Z","snapshot_observed_at":"2026-08-16T13:41:20.972895Z","submitted_at":"2024-06-19T18:31:23Z","title":"FastPersist: Accelerating Model Checkpointing in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13768","snapshot_observed_at":"2026-08-03T08:30:55.610643Z","title":"Fastpersist: Ac- celerating model checkpointing in deep learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.610643Z"},"links":{"cited_paper":"/paper/2406.13768","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:b0ef022e9dadb2b24c1752ff8347c664ce272cab9f22a46a5b6c286012711839","observation_id":"7fc18c1c-7f90-4ad5-86e0-a9d0a804edd4","resolution":{"observed_at":"2026-08-03T08:30:55.610643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.703124Z","title":"Datastates-llm: Lazy asynchronous checkpointing for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.703124Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:ac96f6eef0445fafd59ec518bd643d3bdbcddfd8c2b1e9d863de98a1ea986131","observation_id":"c9f1de20-8b8f-4fbe-b57d-225d92fc3d7a","resolution":{"observed_at":"2026-08-03T08:30:55.703124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.778591Z","title":"Welcome to the torchsnapshot documentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.778591Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:46b95cf60fe2dac87c19662763d87ac4039300e483fea8c8e5a2c061c6b0d62b","observation_id":"51f573d2-766b-4c3b-add4-9a99b71594b4","resolution":{"observed_at":"2026-08-03T08:30:55.778591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.871968Z","title":"CheckFreq: Frequent, Fine-Grained DNN checkpointing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.871968Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:16fc66ad9ba1b8e9b1553f6ef3fc72d3a57b2f97e15946708f058281fe480cb2","observation_id":"d28926fd-ef96-4cd1-9080-94b2ae94240b","resolution":{"observed_at":"2026-08-03T08:30:55.871968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.919233Z","title":"Gemini: Fast failure recovery in distributed training with in-memory checkpoints,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.919233Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:43109730f87d2693ab9e5ed56e633a37e84ca6c56c668d1843c4e8f7bb820749","observation_id":"82835cb8-493f-4363-8f87-5484abfd7394","resolution":{"observed_at":"2026-08-03T08:30:55.919233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:55.983736Z","title":"DeepFreeze: Towards Scalable Asynchronous Checkpointing of Deep Learning Models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:55.983736Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:03de2de4b81eb9972e33fd3272c9cde6d727ebf1f05a15e0e742befc56d5c3d7","observation_id":"3c97120e-1d6f-4131-aaff-86f91a5f9f31","resolution":{"observed_at":"2026-08-03T08:30:55.983736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.040591Z","title":"Reliable and efficient in-memory fault tolerance of large language model pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.040591Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:b3859d8d1886252f93327d3bd6541ef810c5b664df616c8d44e6e4a69d45882d","observation_id":"8215de6d-c59d-4afb-96cb-00aae19ec539","resolution":{"observed_at":"2026-08-03T08:30:56.040591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.096554Z","title":"Optimize Checkpoint Performance for Large Models - Azure Machine Learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.096554Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:d9c5b6781c2ce52019c85e36f1631c4cd791dd0c21f0821e6f00c7a15adc1b36","observation_id":"ae48085a-f023-4995-a895-81031b58143f","resolution":{"observed_at":"2026-08-03T08:30:56.096554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.153666Z","title":"Zero- infinity: breaking the gpu memory wall for extreme scale deep learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.153666Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:f72727ea6d8e041d88bde6e089d6ec572501732c6f0be771abe5d957481fb7d3","observation_id":"06e409a5-02f4-4eb3-8a9a-e9f613a64cea","resolution":{"observed_at":"2026-08-03T08:30:56.153666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.254023Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Mod- els Using Model Parallelism,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.254023Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:d052b70278294de9ffc72f7b5c70a5ff307164ddac2139a65f91333438701b9d","observation_id":"8f83c0ba-35da-4f22-b9ca-68e46dc9ae71","resolution":{"observed_at":"2026-08-03T08:30:56.254023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.352544Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.352544Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:59d443d876fb0877f436698fe586a17fdbee662cecd19c4385e199a7d61af0bf","observation_id":"2ae6e332-9d87-40fa-92a3-2d5207d3e625","resolution":{"observed_at":"2026-08-03T08:30:56.352544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.449326Z","title":"Understanding llm checkpoint/restore i/o strategies and patterns,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.449326Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:c103fd98f439705ca9582d719c0f3fa60bdbb0631acb94fed525606cdd66041d","observation_id":"e8fde21f-36ea-4ae7-a3df-4345f259b720","resolution":{"observed_at":"2026-08-03T08:30:56.449326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.535282Z","title":"A cost-efficient failure-tolerant scheme for distributed dnn training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.535282Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:6937b66b38df4e68c3b10d69d5b8b8e1b0928898ef3d3d5344435f9269935872","observation_id":"413dc35e-aba8-4037-849b-aba4f18523e6","resolution":{"observed_at":"2026-08-03T08:30:56.535282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.597408Z","title":"Transom: An efficient fault-tolerant system for training llms,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.597408Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:d6125c2ec39fd411a642e9e09885096013981fc4a06e725dac39ae06ec6adc3d","observation_id":"347f7a01-18c5-4cd1-9588-62fd6da8892c","resolution":{"observed_at":"2026-08-03T08:30:56.597408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.656575Z","title":"Berkeley lab checkpoint/restart (blcr) for linux clusters,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.656575Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:6da9076fdfea409e913faa2a3caee571313c18c0c2ef3529766e035ba255c5a5","observation_id":"59c1728f-cd2d-446c-83c7-39cad25b5f66","resolution":{"observed_at":"2026-08-03T08:30:56.656575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.740816Z","title":"Checuda: A checkpoint/restart tool for cuda applications,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.740816Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:fb02f40551cca207bb6d905fc0af00f7bac49d141b14f2d47661050f14f90dd2","observation_id":"9f7c1e1f-8c4d-400e-a40a-7a66bb9a2c78","resolution":{"observed_at":"2026-08-03T08:30:56.740816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:56.876667Z","title":"VeloC: Towards High Performance Adaptive Asynchronous Check- pointing at Large Scale,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:56.876667Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:e40688929ed206fe2955be689fd089621eff4e7a71e02313f1608ecd077df039","observation_id":"937fca11-d27c-4518-966f-59980c61fac8","resolution":{"observed_at":"2026-08-03T08:30:56.876667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.011067Z","title":"Towards Efficient Cache Allocation for High-Frequency Checkpointing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.011067Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:e0eeb68ca5424c80a2c36e8cdd88cbb196d5279af2f710f700b16dc8ee5209ad","observation_id":"434eb340-2dce-453b-9863-493b5a62673f","resolution":{"observed_at":"2026-08-03T08:30:57.011067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.079129Z","title":"GPU-Enabled Asynchronous Multi-level Checkpoint Caching and Prefetching,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.079129Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:b3ea16d9643abdeb78855300ff363d0273e00607477859efa6172e28898885ea","observation_id":"333af9dc-f4cd-434f-b808-ab0fc767a0a6","resolution":{"observed_at":"2026-08-03T08:30:57.079129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.142287Z","title":"Checkpoint restart support for heterogeneous hpc applications,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.142287Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:6caad42bf37707f63e42e80d54d259084870fa6a6a2df8f3ea2f323021a40be7","observation_id":"1c341511-4424-4445-96bd-507ea5834b8c","resolution":{"observed_at":"2026-08-03T08:30:57.142287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.208517Z","title":"Adios 2: The adaptable input output system. a framework for high-performance data management,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.208517Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:41594d192b86c0696e77dcd6150270f0ade52a31f35fc967f532cbb28fd9e3ec","observation_id":"c72bbc8a-17ef-427d-bc60-a73dc6a72564","resolution":{"observed_at":"2026-08-03T08:30:57.208517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.276827Z","title":"An overview of gradient descent optimization algorithms,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.276827Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:32caad7b88896f02911ac2b13889b4063431c38c825e4a205fd2f0c4d7cd76e1","observation_id":"e3f0cd8b-0f5c-477d-9128-36a56a691d98","resolution":{"observed_at":"2026-08-03T08:30:57.276827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.450739Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.450739Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:40b108fed5444215ec9c17ed65e2080829b64a54d7bf3fcea195169a2f5961d3","observation_id":"4d951ac7-d575-42a4-9883-708b82301d30","resolution":{"observed_at":"2026-08-03T08:30:57.450739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-08-12T13:00:33.339808Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-03T08:30:57.589590Z","title":"Mixed precision training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.589590Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:ba3603130ea4fbee652e395f62316965aa400eb3235525c16e682d6f972a9e81","observation_id":"79ac9fa6-930f-436d-9db4-42135a710bbc","resolution":{"observed_at":"2026-08-03T08:30:57.589590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-03T08:30:57.516419Z","title":"Available: https://arxiv.org/abs/1412.6980","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.516419Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:b3b13fd8a107326010f3e7b16d1e7805a4919c3dd67c24d27ff9eb3e32f0c1a3","observation_id":"f47b20f2-689e-457a-a4d7-222ee2868f08","resolution":{"observed_at":"2026-08-03T08:30:57.516419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.671452Z","title":"Polaris,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.671452Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:d3711da41bc353ea12b475de67853b75f30502534f7c587255f809c78f4d1b53","observation_id":"b5726e1c-a469-4c55-9868-aa892988d9a3","resolution":{"observed_at":"2026-08-03T08:30:57.671452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.610290Z","title":"Asynccheckpointio– pytorch lightning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.610290Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:2bcc1dbf2ad277aa9dbcbc208f3c52b79455c658da83a03c4dbf4ec4a7f90097","observation_id":"bffa5578-05b1-4d36-8146-29c46a95ee6b","resolution":{"observed_at":"2026-08-03T08:30:57.610290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.861433Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.861433Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:857f928f53a517443e168c425a378f9eabbe3a972587effc54a6234a69d02956","observation_id":"9d1dde8f-43cb-4a54-85ed-c1e81e725bc8","resolution":{"observed_at":"2026-08-03T08:30:57.861433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:30:57.769330Z","title":"Lustre: Building a file system for 1000-node clusters,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.769330Z"},"links":{"citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:9ec6c98a1b4f12d76adb63452ae1a1584e3974c7a32ac1c76a4c95b26a0b79c2","observation_id":"94c7494d-6f77-431b-a8b3-03bfd525090c","resolution":{"observed_at":"2026-08-03T08:30:57.769330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04747","last_updated":"2017-06-15T13:21:04Z","snapshot_observed_at":"2026-08-15T03:49:17.013617Z","submitted_at":"2016-09-15T17:32:34Z","title":"An overview of gradient descent optimization algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04747","snapshot_observed_at":"2026-08-03T08:30:57.370717Z","title":"Available: https://arxiv.org/abs/1609.04747","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.370717Z"},"links":{"cited_paper":"/paper/1609.04747","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:c57e400784b143f863643d8ae7f83b80a9b7e1c508591d23118dc88e7b189196","observation_id":"d4d5a879-a7d5-44bc-b7a3-fe72d6472b1c","resolution":{"observed_at":"2026-08-03T08:30:57.370717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-19T02:28:32.451164Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2601.16956."}