{"as_of":"2026-08-23T22:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64c2dc244b66a1b5a6475b89977f45e73f0ee31dd7bd4abcd134cbb3c79188d0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T05:49:10.102076Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T02:29:25.467389Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":"2101.06840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2101.06840 [cs.DC]https://arxiv.org/abs/2101.06840","venue":null,"work_id":"3ed4aeb5-782f-4417-ab19-e37973a89707","year":2021},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:8d0de881ab94229ff535dff9f9826ef7ab26b9714f8cacc5b16cbc48d1a6d7c1","observation_id":"6f09a7bd-06a9-4200-b46f-e61178dc17e7","resolution":{"observed_at":"2026-05-11T14:16:25.884336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-11T13:44:15.517148Z","title":"Y.; Ruwase, O.; Yang, S.; Zhang, M.; Li, D.; and He, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12865","last_updated":"2024-12-17T12:49:14Z","snapshot_observed_at":"2026-08-19T12:06:47.256828Z","submitted_at":"2024-12-17T12:49:14Z","title":"Preference-Oriented Supervised Fine-Tuning: Favoring Target Model Over Aligned Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T13:44:15.517148Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2412.12865"},"observation_digest":"sha256:db0509f956b775b174b44418484e7f08be438d5cfeae853ecea988022438744e","observation_id":"1a7350ec-65db-48e0-8758-936a44e8f0c5","resolution":{"observed_at":"2026-08-11T13:44:15.517148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-11T11:04:15.936377Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15891","last_updated":"2024-12-20T13:47:02Z","snapshot_observed_at":"2026-08-11T15:11:14.947889Z","submitted_at":"2024-12-20T13:47:02Z","title":"TelcoLM: collecting data, adapting, and benchmarking language models for the telecommunication domain","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T11:04:15.936377Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2412.15891"},"observation_digest":"sha256:c8a31cda7fbc0660e74ec1162a26d70ed04434aab3e64104924bdeb030d4c7e7","observation_id":"c62f4314-1d2e-4b3d-8812-0bfdfcd3d386","resolution":{"observed_at":"2026-08-11T11:04:15.936377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-10T22:50:28.765359Z","title":"Zero-offload: Democratizing billion-scale model training, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00692","last_updated":"2025-01-01T01:10:59Z","snapshot_observed_at":"2026-08-15T00:24:10.943939Z","submitted_at":"2025-01-01T01:10:59Z","title":"Adjoint sharding for very long context training of state space models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:50:28.765359Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2501.00692"},"observation_digest":"sha256:ab2d4151a8e87270aa5db469ed5202508319be9767071cb535773df4fb5af920","observation_id":"87cd75ca-9024-4b70-9036-d4edcb65e7c0","resolution":{"observed_at":"2026-08-10T22:50:28.765359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-10T21:48:15.226897Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training [Internet]","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05479","last_updated":"2025-01-07T17:11:12Z","snapshot_observed_at":"2026-08-15T23:42:39.743707Z","submitted_at":"2025-01-07T17:11:12Z","title":"Practical Design and Benchmarking of Generative AI Applications for Surgical Billing and Coding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:48:15.226897Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2501.05479"},"observation_digest":"sha256:54d19c0797d9f9dd84a65b5fd1c726792589d91ceeddee75e209919f5facb0eb","observation_id":"24ae9a37-3de0-472f-ac5b-de0e4f945a3c","resolution":{"observed_at":"2026-08-10T21:48:15.226897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-10T18:01:46.357295Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-17T14:25:14.988730Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.357295Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:d734da11282346a009f49b8588facab3311f8e46fd4d7edc00d50c9d3f54f3cf","observation_id":"f8781437-3a20-4210-8d3c-598c1a342079","resolution":{"observed_at":"2026-08-10T18:01:46.357295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-16T05:49:10.102076Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.19720","last_updated":"2025-04-28T12:14:02Z","snapshot_observed_at":"2026-08-19T00:58:17.913230Z","submitted_at":"2025-04-28T12:14:02Z","title":"Taming the Titans: A Survey of Efficient LLM Inference Serving","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-16T05:49:10.102076Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2504.19720"},"observation_digest":"sha256:d869ba5a63bf1d7f3ea438a272ecfcba2ed010629d4fa2b09aac5486d3bd259f","observation_id":"ee17e96a-63e9-4342-a638-70190e5af613","resolution":{"observed_at":"2026-08-16T05:49:10.102076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-15T22:25:53.111264Z","title":"Zero-offload: Democratizing billion-scale model training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07291","last_updated":"2025-05-12T07:24:33Z","snapshot_observed_at":"2026-08-22T02:39:56.456121Z","submitted_at":"2025-05-12T07:24:33Z","title":"INTELLECT-2: A Reasoning Model Trained Through Globally Decentralized Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:25:53.111264Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2505.07291"},"observation_digest":"sha256:de2a7a8128388418287880280c6029995b97d82074f4020797d9d4c161379329","observation_id":"0f8ab8ff-fc6c-48c9-a51e-7f85312a48f0","resolution":{"observed_at":"2026-08-15T22:25:53.111264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-07T11:17:36.966763Z","title":"Zero-offload: Democratizing billion-scale model training.arXiv preprint arXiv:2101.06840, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03077","last_updated":"2025-06-03T16:54:15Z","snapshot_observed_at":"2026-08-16T17:48:46.961655Z","submitted_at":"2025-06-03T16:54:15Z","title":"StreamBP: Memory-Efficient Exact Backpropagation for Long Sequence Training of LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:36.966763Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2506.03077"},"observation_digest":"sha256:100e44e44d4db78755175b9a0ae8f102f4e1599d398080355ba4e5b05019f8ae","observation_id":"9d289a50-00d3-4dce-b04c-517a15cf9229","resolution":{"observed_at":"2026-08-07T11:17:36.966763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-05T22:58:28.214083Z","title":"ZeRO-Offload: Democratizing billion-scale model training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09194","last_updated":"2025-08-08T09:53:53Z","snapshot_observed_at":"2026-08-17T03:19:35.011934Z","submitted_at":"2025-08-08T09:53:53Z","title":"Meta-Learning for Speeding Up Large Model Inference in Decentralized Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:28.214083Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2508.09194"},"observation_digest":"sha256:b1ad029826bac6b5904a549489b787d8b0ff231125ec8923c7f81a53daa2038f","observation_id":"2110afe0-67c5-4140-9e9b-df5b4b7e3dc5","resolution":{"observed_at":"2026-08-05T22:58:28.214083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-03T12:03:26.187156Z","title":"Zero-offload: Democratizing billion-scale model training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.04710","last_updated":"2026-06-10T03:47:11Z","snapshot_observed_at":"2026-08-16T23:55:55.648562Z","submitted_at":"2026-01-08T08:27:15Z","title":"Steering the Noise: Turning Random Perturbations into Effective Descent for Memory-Efficient LLM Fine-Tuning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T12:03:26.187156Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2601.04710"},"observation_digest":"sha256:df04592b15d52438d7bfd965abc86b3497ad949e3fce6fb51f8e85e557f2e95f","observation_id":"7d326a68-20bb-44e4-b59a-0e462889b87f","resolution":{"observed_at":"2026-08-03T12:03:26.187156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":"2101.06840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2101.06840 [cs.DC]https://arxiv.org/abs/2101.06840","venue":null,"work_id":"3ed4aeb5-782f-4417-ab19-e37973a89707","year":2021},"citing_paper":{"arxiv_id":"2604.23036","last_updated":"2026-04-24T21:48:20Z","snapshot_observed_at":"2026-08-11T02:56:27.037128Z","submitted_at":"2026-04-24T21:48:20Z","title":"Preserving Long-Tailed Expert Information in Mixture-of-Experts Tuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T12:03:58.279499Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2604.23036"},"observation_digest":"sha256:ad241cb45a39adac2b53160adea5fecedee05510acdf3087e7fd90796922c78f","observation_id":"9672136a-518e-4c30-851e-7bb5d7ebe336","resolution":{"observed_at":"2026-05-11T19:21:09.679054Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":"2101.06840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2101.06840 [cs.DC]https://arxiv.org/abs/2101.06840","venue":null,"work_id":"3ed4aeb5-782f-4417-ab19-e37973a89707","year":2021},"citing_paper":{"arxiv_id":"2604.27085","last_updated":"2026-04-29T18:26:13Z","snapshot_observed_at":"2026-08-11T17:43:29.951165Z","submitted_at":"2026-04-29T18:26:13Z","title":"Efficient Training on Multiple Consumer GPUs with RoundPipe","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T10:37:22.251566Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2604.27085"},"observation_digest":"sha256:0ee5e5119e47e72edec546091519f7db56d63817c72726b7bae449def84d8336","observation_id":"6e4d8598-dae2-4139-a146-7a330834968d","resolution":{"observed_at":"2026-05-12T09:31:26.806007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":"2101.06840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2101.06840 [cs.DC]https://arxiv.org/abs/2101.06840","venue":null,"work_id":"3ed4aeb5-782f-4417-ab19-e37973a89707","year":2021},"citing_paper":{"arxiv_id":"2605.20863","last_updated":"2026-05-20T07:55:06Z","snapshot_observed_at":"2026-08-16T22:24:31.346100Z","submitted_at":"2026-05-20T07:55:06Z","title":"PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T02:24:48.872065Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2605.20863"},"observation_digest":"sha256:9f330e48ba955a41803dce6e2ace5ed29322285ba6226b109665294bc65efc2b","observation_id":"4ee168a2-5bd8-4ea7-aee4-6535d948333d","resolution":{"observed_at":"2026-05-21T02:29:25.470695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-14T04:31:49.767449Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08740","last_updated":"2026-08-09T14:36:19Z","snapshot_observed_at":"2026-08-20T11:25:07.234798Z","submitted_at":"2026-08-09T14:36:19Z","title":"Memory-Efficient Activation Checkpointing with Sliding Window and Hirschberg's Algorithm for 0/1 Knapsack Solving in PyTorch","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:31:49.767449Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2608.08740"},"observation_digest":"sha256:e66f79b3c4058a71dce6cebb904c9766fcc56bbb6e0e38976691bfc0d4ac8b4d","observation_id":"4f838c85-c32c-4f75-95d2-955780b43977","resolution":{"observed_at":"2026-08-14T04:31:49.767449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-14T04:16:17.067120Z","title":"2101.06840 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10260","last_updated":"2026-08-10T21:49:45Z","snapshot_observed_at":"2026-08-18T23:29:35.171466Z","submitted_at":"2026-08-10T21:49:45Z","title":"Interpreting Language Model Hidden States at Scale","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:17.067120Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2608.10260"},"observation_digest":"sha256:2b41eccee9b62cde70bf2777b64c8d64b2080216d892c040675235e8bd90a41b","observation_id":"e7e33618-595a-4f2c-8e6d-b48460f01c7a","resolution":{"observed_at":"2026-08-14T04:16:17.067120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2101.06840/citation-record","integrity":"/paper/2101.06840/integrity","json":"/paper/2101.06840/citation-record.json","paper":"/paper/2101.06840"},"outbound":[],"paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-16T18:51:46.129753Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2101.06840."}