{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:L5AXDG3PU6VOFEAQEQMRIYOY6F","short_pith_number":"pith:L5AXDG3P","schema_version":"1.0","canonical_sha256":"5f41719b6fa7aae2901024191461d8f1460affcaef6722aa3a39064d71843e76","source":{"kind":"arxiv","id":"2406.14088","version":2},"attestation_state":"computed","paper":{"title":"ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.DC","authors_text":"Guangju Wang, Huanchen Zhang, Kaiwei Li, Wei Fu, Yi Wu, Zhiyu Mei","submitted_at":"2024-06-20T08:04:07Z","abstract_excerpt":"Reinforcement Learning from Human Feedback (RLHF) is a pivotal technique for empowering large language model (LLM) applications. Compared with the supervised training process of LLMs, the RLHF training process is much more sophisticated, requiring a diverse range of computation workloads with intricate dependencies between multiple LLM instances. Therefore, simply adopting the fixed parallelization strategies from supervised training for LLMs can be insufficient for RLHF and result in low training efficiency. To overcome this limitation, we propose a novel technique named parameter ReaLlocatio"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.14088","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.DC","submitted_at":"2024-06-20T08:04:07Z","cross_cats_sorted":["cs.AI","cs.CL","cs.LG"],"title_canon_sha256":"da7ec43cbeb19100f4ef4804d02de73984a8aa2b0ed119a868b59912cfe19823","abstract_canon_sha256":"11bc9b4cca7caa5a4acc3c936471da2ddd258f74bd4c03cf64a7d1c975954f95"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:53:10.623860Z","signature_b64":"KDUuwzTma/ttyoUr77ZJjvDwDFXDU83oFQgHEOFrPLxfsuE5hxwvcMdJzjJAEj8x9CvPb1QvMccE2jpIaFZTAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5f41719b6fa7aae2901024191461d8f1460affcaef6722aa3a39064d71843e76","last_reissued_at":"2026-07-05T10:53:10.623392Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:53:10.623392Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.LG"],"primary_cat":"cs.DC","authors_text":"Guangju Wang, Huanchen Zhang, Kaiwei Li, Wei Fu, Yi Wu, Zhiyu Mei","submitted_at":"2024-06-20T08:04:07Z","abstract_excerpt":"Reinforcement Learning from Human Feedback (RLHF) is a pivotal technique for empowering large language model (LLM) applications. Compared with the supervised training process of LLMs, the RLHF training process is much more sophisticated, requiring a diverse range of computation workloads with intricate dependencies between multiple LLM instances. Therefore, simply adopting the fixed parallelization strategies from supervised training for LLMs can be insufficient for RLHF and result in low training efficiency. To overcome this limitation, we propose a novel technique named parameter ReaLlocatio"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.14088","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.14088/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.14088","created_at":"2026-07-05T10:53:10.623449+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.14088v2","created_at":"2026-07-05T10:53:10.623449+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.14088","created_at":"2026-07-05T10:53:10.623449+00:00"},{"alias_kind":"pith_short_12","alias_value":"L5AXDG3PU6VO","created_at":"2026-07-05T10:53:10.623449+00:00"},{"alias_kind":"pith_short_16","alias_value":"L5AXDG3PU6VOFEAQ","created_at":"2026-07-05T10:53:10.623449+00:00"},{"alias_kind":"pith_short_8","alias_value":"L5AXDG3P","created_at":"2026-07-05T10:53:10.623449+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":6,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.01120","citing_title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01120","citing_title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20863","citing_title":"PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15565","citing_title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2511.14617","citing_title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.09107","citing_title":"TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F","json":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F.json","graph_json":"https://pith.science/api/pith-number/L5AXDG3PU6VOFEAQEQMRIYOY6F/graph.json","events_json":"https://pith.science/api/pith-number/L5AXDG3PU6VOFEAQEQMRIYOY6F/events.json","paper":"https://pith.science/paper/L5AXDG3P"},"agent_actions":{"view_html":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F","download_json":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F.json","view_paper":"https://pith.science/paper/L5AXDG3P","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.14088&json=true","fetch_graph":"https://pith.science/api/pith-number/L5AXDG3PU6VOFEAQEQMRIYOY6F/graph.json","fetch_events":"https://pith.science/api/pith-number/L5AXDG3PU6VOFEAQEQMRIYOY6F/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F/action/timestamp_anchor","attest_storage":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F/action/storage_attestation","attest_author":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F/action/author_attestation","sign_citation":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F/action/citation_signature","submit_replication":"https://pith.science/pith/L5AXDG3PU6VOFEAQEQMRIYOY6F/action/replication_record"}},"created_at":"2026-07-05T10:53:10.623449+00:00","updated_at":"2026-07-05T10:53:10.623449+00:00"}