{"as_of":"2026-08-10T21:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2afba34dd413a229f9c85f0f7cf28bd5b3314ff19bb5d748b58039f138f62c1c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:21:37.458748Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":10,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:f4a7c9786d922a52a34ed2adeb605dc108dc6a41386d6fe3393949a8c023562c","observation_id":"a8da933d-fddd-4d6c-9a12-82d3fa422edf","resolution":{"observed_at":"2026-05-10T22:46:40.026523Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T03:28:57.008431Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2405.11143"},"observation_digest":"sha256:3bc999c652515195765ba28d2b34954f0cfbc2279b875a29566f4e2d8fe728c3","observation_id":"a1c3eae2-2f4a-4e22-8be7-d9e6e31897b5","resolution":{"observed_at":"2026-05-15T03:28:57.132277Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-11T07:53:38.715353Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2409.19256"},"observation_digest":"sha256:66d47f66b5202db16170947a0f97fa92e47f60de0f7504df2c1f0586ed83b37b","observation_id":"81152436-d2f4-4828-83bc-53f101f250ce","resolution":{"observed_at":"2026-05-11T07:53:38.949833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-10T18:21:37.458748Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11463","last_updated":"2025-05-31T16:08:55Z","snapshot_observed_at":"2026-08-10T18:11:45.299566Z","submitted_at":"2025-01-20T12:51:40Z","title":"Curiosity-Driven Reinforcement Learning from Human Feedback","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T18:21:37.458748Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2501.11463"},"observation_digest":"sha256:669b04eaeaadf4d4c00206e61510134965303a5dc1a86f3d3ae5f1eeef78735b","observation_id":"9fb83aab-dfe0-4eaa-83ea-22db674c60c9","resolution":{"observed_at":"2026-08-10T18:21:37.458748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-10T00:11:59.487147Z","title":"Y., Ruwase, O., Rajbhandari, S., Wu, X., Awan, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18282","last_updated":"2025-06-03T20:18:22Z","snapshot_observed_at":"2026-08-10T12:39:44.668328Z","submitted_at":"2025-01-30T11:41:13Z","title":"Leveraging Sparsity for Sample-Efficient Preference Learning: A Theoretical Perspective","version":4},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-10T00:11:59.487147Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2501.18282"},"observation_digest":"sha256:1cba3aea5d2cdd1c2e360129d19ce0b18c017bdd188a70e62901ac51b387bfc1","observation_id":"2cb093db-74b0-4c15-9e31-db362efb60fc","resolution":{"observed_at":"2026-08-10T00:11:59.487147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-09T17:46:29.299748Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00814","last_updated":"2025-05-19T08:24:51Z","snapshot_observed_at":"2026-08-10T21:55:35.870902Z","submitted_at":"2025-02-02T14:50:25Z","title":"Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T17:46:29.299748Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2502.00814"},"observation_digest":"sha256:821cb26d95d6ef1970b97ca867f3e4dacc2e1b0d36beb247af0c68289d7a60aa","observation_id":"ae705c90-d7b1-4065-86eb-f4a8027ba4af","resolution":{"observed_at":"2026-08-09T17:46:29.299748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-08T11:26:27.871302Z","title":"arXiv:2308.01320 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10450","last_updated":"2025-06-11T17:44:34Z","snapshot_observed_at":"2026-08-09T04:10:19.287139Z","submitted_at":"2025-02-11T20:08:42Z","title":"Trustworthy AI: Safety, Bias, and Privacy -- A Survey","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T11:26:27.871302Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2502.10450"},"observation_digest":"sha256:7baf08198893393c31b9b9ec42817385f5ef9bdfd6c07a32bd2356178bf79918","observation_id":"8a346cb7-c05c-40d9-adb2-bbddb6a051d4","resolution":{"observed_at":"2026-08-08T11:26:27.871302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-07T10:45:07.106711Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04544","last_updated":"2025-07-08T19:43:08Z","snapshot_observed_at":"2026-08-09T07:21:08.241363Z","submitted_at":"2025-06-05T01:29:18Z","title":"hdl2v: A Code Translation Dataset for Enhanced LLM Verilog Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:07.106711Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2506.04544"},"observation_digest":"sha256:e4177dae8484dd0986e81b974f42068c8cf4581ac486088f37eb7f8cf467a8f6","observation_id":"97efdee9-ee8b-4ccc-bce1-73c6eaed10ff","resolution":{"observed_at":"2026-08-07T10:45:07.106711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-06T20:50:26.921368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.921368Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:2d45d28261c00955abc127d1848bcd69563de6f3099dbf4a3a4e4d119297751d","observation_id":"31e20e14-e2d7-48c2-8f4b-62ff40c7919f","resolution":{"observed_at":"2026-08-06T20:50:26.921368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-06T19:59:36.363859Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales.arXiv preprint arXiv:2308.01320, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-08T15:50:06.172618Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:36.363859Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2507.04136"},"observation_digest":"sha256:4775dc0d90ffc057e5ce8f408bec32e539c65a7baa35489e333628b8237d3a2e","observation_id":"1c61dd39-2429-487e-a5fc-91c87cd3b8a4","resolution":{"observed_at":"2026-08-06T19:59:36.363859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T23:43:05.560349Z","title":"Y.; Ruwase, O.; Rajbhandari, S.; Wu, X.; Awan, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05011","last_updated":"2025-08-07T03:49:18Z","snapshot_observed_at":"2026-08-06T05:37:26.433479Z","submitted_at":"2025-08-07T03:49:18Z","title":"Towards Hallucination-Free Music: A Reinforcement Learning Preference Optimization Framework for Reliable Song Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T23:43:05.560349Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2508.05011"},"observation_digest":"sha256:97eab3da4d3996344e07a368fb71f4f59b303c3baa8fd0a149d9828c430b9f77","observation_id":"925590c5-9fb1-4b36-a820-e55fa5a3b877","resolution":{"observed_at":"2026-08-05T23:43:05.560349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T23:26:57.319056Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05387","last_updated":"2025-08-12T15:23:04Z","snapshot_observed_at":"2026-08-07T12:10:11.549864Z","submitted_at":"2025-08-07T13:37:04Z","title":"Echo: Decoupling Inference and Training for Large-Scale RL Alignment on Heterogeneous Swarms","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:26:57.319056Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2508.05387"},"observation_digest":"sha256:58e3b3b03f3dda0fdeb53142feb5e0710a14727350bc05577170bdb5b5e3d77e","observation_id":"c2e9a5d5-ed78-4f19-9f40-9bf2c675bda2","resolution":{"observed_at":"2026-08-05T23:26:57.319056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-04T16:07:45.810430Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":225,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:45.810430Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:450fb02e9d36607d74083596c8f7a3206f0927faeb2ec754873b72997d373cff","observation_id":"9e334d77-5ec9-4c76-b73f-dc6bf5d9b267","resolution":{"observed_at":"2026-08-04T16:07:45.810430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T20:38:30.169363Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2511.14617"},"observation_digest":"sha256:8608917c79137757bedd6ac19d611bfc66759720d143eab4e34329dccec67acb","observation_id":"854279e9-d260-4a88-9ef2-3f3bf087e8aa","resolution":{"observed_at":"2026-05-17T20:40:14.512467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2511.18871","last_updated":"2026-08-07T11:10:35Z","snapshot_observed_at":"2026-08-10T21:09:05.992400Z","submitted_at":"2025-11-24T08:22:50Z","title":"Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning","version":7},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T05:33:46.817183Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2511.18871"},"observation_digest":"sha256:42b5295488c9c9f6a362674cdb7fc201e46fb03a39d6ea9d13efccbeed60dbdf","observation_id":"320429c6-cee5-4569-8a60-7b8e42716a9b","resolution":{"observed_at":"2026-05-17T05:34:04.919439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2512.12476","last_updated":"2026-04-11T14:05:07Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-13T22:20:51Z","title":"HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-16T22:21:26.271796Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2512.12476"},"observation_digest":"sha256:e79c9acafd38d17676dd662d1a49e16078bb70dd28b2d743c0e50aca507725ac","observation_id":"91d20183-0493-4ff5-9269-c0bd1ad03359","resolution":{"observed_at":"2026-05-16T22:23:36.659585Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2601.18150","last_updated":"2026-04-10T15:41:56Z","snapshot_observed_at":"2026-08-02T16:35:13.446446Z","submitted_at":"2026-01-26T05:12:05Z","title":"FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T11:07:18.839899Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2601.18150"},"observation_digest":"sha256:69781b54be8c3d9e769c608fc3bca240ae5e385b893bd50662f5959d8a3d904c","observation_id":"6a8f4821-a09c-4daa-a10a-b230ba7d5b2e","resolution":{"observed_at":"2026-05-16T11:07:47.104402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-02T17:01:43.630573Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales.arXiv preprint arXiv:2308.01320, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.00368","last_updated":"2026-07-24T03:02:29Z","snapshot_observed_at":"2026-08-07T03:52:02.248035Z","submitted_at":"2026-04-01T01:29:03Z","title":"TENT: A Declarative Slice Spraying Engine for Performant and Resilient Data Movement in Disaggregated LLM Serving","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T17:01:43.630573Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2604.00368"},"observation_digest":"sha256:08771c08b9267e9dd5cf59983a7067afa3c1bbd940394d2ebca145385091378b","observation_id":"46372f89-f4c5-4dd3-a354-abca0291a1ad","resolution":{"observed_at":"2026-08-02T17:01:43.630573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2604.02507","last_updated":"2026-04-02T21:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-02T21:04:17Z","title":"Reinforcement Learning from Human Feedback: A Statistical Perspective","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-13T20:10:43.578904Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2604.02507"},"observation_digest":"sha256:5f1601c5445803048287887ad9466b9cd52b866ce0b3a7908f98bf0cf2979a8c","observation_id":"0025aedf-01b9-4e91-a04c-311a574f183e","resolution":{"observed_at":"2026-05-13T20:13:13.726538Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2604.23838","last_updated":"2026-04-26T18:45:31Z","snapshot_observed_at":"2026-08-02T18:30:10.398959Z","submitted_at":"2026-04-26T18:45:31Z","title":"JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-08T06:36:33.914193Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2604.23838"},"observation_digest":"sha256:ffc5c5d58af55f44e5e56331ad03a69783331e3b80b801225bb1e93fc807ff27","observation_id":"49c70956-40a4-4cb5-9270-5de56d9f3a92","resolution":{"observed_at":"2026-05-11T21:11:11.055339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2604.26256","last_updated":"2026-04-29T03:25:36Z","snapshot_observed_at":"2026-07-06T23:11:57.238808Z","submitted_at":"2026-04-29T03:25:36Z","title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T13:49:26.560459Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2604.26256"},"observation_digest":"sha256:72f63331367a9602e60329c594c5da34013f33ec27e9b6424c6038cd3a0b7c29","observation_id":"9a61df6f-04b7-41ff-b383-ab7013fb6cdf","resolution":{"observed_at":"2026-05-12T08:46:26.338424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-08T10:12:58.421050Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:bc3d27961886cde255b26cbd214d3d8c3c0f6a8b1df88deb36146f93d88daf8f","observation_id":"7c63bc60-5e50-4d1b-a984-356098c4ecc9","resolution":{"observed_at":"2026-05-11T20:06:18.446759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:48.838028Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:551c7c071ae3697d88bc8c4ee99342d4b901a41f0c26d08f4c41022a01d42558","observation_id":"6c0aa9ae-c00e-41e6-97bc-eaca23fed6e4","resolution":{"observed_at":"2026-05-11T05:00:54.475637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:dcfd94d201bcc6dbd3dcea629e660f985305aa350fcd7c0b50ce59532e356efd","observation_id":"ec74e6e1-88e0-407e-97f9-b0b76e09f3b6","resolution":{"observed_at":"2026-05-11T21:31:16.480776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:8a7565d757b4902392d5f7ae3fc5a70c92822b78f7a5a614a8552e1d78f32e24","observation_id":"81aa4c7c-fa99-4278-bbf4-f768a620a14b","resolution":{"observed_at":"2026-05-21T08:39:53.327060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2605.20863","last_updated":"2026-05-20T07:55:06Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:55:06Z","title":"PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T02:24:48.872065Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2605.20863"},"observation_digest":"sha256:1ba6a4037d0d3d39d86de792721d30060f861e85906b58cb1df68cccca532d15","observation_id":"c8cdc8e8-cd28-44a5-9c50-c99de0989ddb","resolution":{"observed_at":"2026-05-21T02:29:25.369999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2605.26606","last_updated":"2026-05-26T06:41:13Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T06:41:13Z","title":"Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T19:47:09.817243Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2605.26606"},"observation_digest":"sha256:8b685a0adf71e360f81f84499e5b11fe64960dfdc9ec9e144fb4ec74ad2eaae6","observation_id":"36f0d166-0b90-4c03-9c82-f3d3b7ca186f","resolution":{"observed_at":"2026-06-29T19:53:55.785979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2606.03077","last_updated":"2026-06-10T06:28:18Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:09:13Z","title":"Libra: Efficient Resource Management for Agentic RL Post-Training","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:00.385932Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2606.03077"},"observation_digest":"sha256:72a4b0f83d94847a5acfd0c9cef4ec3215eb79173c2c8362d1f9b78ebbcba9ed","observation_id":"5fd2bbd8-573f-4685-8264-38363a5652fc","resolution":{"observed_at":"2026-07-02T02:16:27.143876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":"2308.01320","doi":"10.48550/arxiv.2308.01320","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales","venue":"arXiv (Cornell University)","work_id":"3d244678-a776-4393-8ca9-6b3c9a8e3fde","year":2023},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":1},"reference_index":230,"source":"pdf_text","source_observed_at":"2026-06-26T08:09:57.542558Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:3d606740784e1eeaef35ace22a9b832d0885b17cebdd786442dd67b294389d05","observation_id":"b60fc586-0338-4925-bad5-7fe6ee500f3a","resolution":{"observed_at":"2026-07-04T11:09:46.498426Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-02T10:27:18.522221Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-Like Models at All Scales.arXiv Preprint arXiv:2308.01320, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.24937","last_updated":"2026-07-27T15:17:17Z","snapshot_observed_at":"2026-08-02T23:19:25.465662Z","submitted_at":"2026-06-22T17:48:54Z","title":"The Hitchhiker's Guide to Agentic AI: From Foundations to Systems","version":2},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-08-02T10:27:18.522221Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2606.24937"},"observation_digest":"sha256:0f2745d8fb37a24746e14bd901ff5e8c4beddb07de71c939058a30c493c7ff1a","observation_id":"cb13f38a-7fff-4397-8a91-7c58abd0a5da","resolution":{"observed_at":"2026-08-02T10:27:18.522221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-07-13T04:42:35.589143Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09207","last_updated":"2026-08-05T13:11:42Z","snapshot_observed_at":"2026-08-08T23:13:02.648188Z","submitted_at":"2026-07-10T08:51:14Z","title":"Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T04:42:35.589143Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2607.09207"},"observation_digest":"sha256:66c0b4e82900ac42e6429960f714d643845d0bf01efe8587e0240ff81ca963cf","observation_id":"907b9312-f955-48fd-917a-976172431ce0","resolution":{"observed_at":"2026-07-13T04:42:35.589143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-01T21:32:07.773505Z","title":"Deepspeed-chat: Easy, fast and affordable rlhf training of chatgpt-like models at all scales.arXiv preprint arXiv:2308.01320, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16074","last_updated":"2026-07-17T15:58:20Z","snapshot_observed_at":"2026-08-10T18:42:30.024031Z","submitted_at":"2026-07-17T15:58:20Z","title":"JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T21:32:07.773505Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2607.16074"},"observation_digest":"sha256:011cd791156965d1cb435e305f73db3da6e42d808fc2ffa65461daff903c0101","observation_id":"b5b7eb1d-f9a0-48cb-9da4-c1c052ed7136","resolution":{"observed_at":"2026-08-01T21:32:07.773505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.01320/citation-record","integrity":"/paper/2308.01320/integrity","json":"/paper/2308.01320/citation-record.json","paper":"/paper/2308.01320"},"outbound":[],"paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T16:01:45.794350Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2308.01320."}