{"as_of":"2026-08-10T22:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87202de27b262ad8fd80d9a363bc23e08be1357560a87c23e5d3cf3e658131be","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:30.237588Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:19:26.241394Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:930077976c67de84b6d91b1454abdb5eae5aaef7080e84bd4a957af3070c5ec4","observation_id":"e74338b5-eb36-4ba3-884a-ddd1729123f4","resolution":{"observed_at":"2026-05-22T19:32:01.297713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-07T04:19:26.241394Z","title":"Llamarl: A distributed asynchronous reinforcement learning framework for efficient large-scale llm trainin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:19:26.241394Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2506.10910"},"observation_digest":"sha256:d323bdd0d3513e7fa98a8d1633a33266d4caf6bcf83a1018cd5b590383f61f16","observation_id":"62aa2849-4bc7-4bce-953f-b36661f1c2ce","resolution":{"observed_at":"2026-08-07T04:19:26.241394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-04T16:07:43.979849Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:43.979849Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:31b1b97011133978ee75c4fceb2f18167600a8b240598244acc385363c61ba7b","observation_id":"77243c07-76f2-453d-878e-2288b1fa8aa7","resolution":{"observed_at":"2026-08-04T16:07:43.979849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2512.12476","last_updated":"2026-04-11T14:05:07Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-13T22:20:51Z","title":"HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-16T22:21:26.271796Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2512.12476"},"observation_digest":"sha256:a03fef6aa94972a94dfd407d612034d9b775e1a77e28c177552441507cf9523a","observation_id":"317ba9ef-ed90-4c32-8c98-33dd0c7d27ea","resolution":{"observed_at":"2026-05-16T22:23:36.641772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-04T06:25:54.516468Z","title":"Llamarl: A distributed asynchronous reinforcement learning framework for efficient large-scale llm training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-07T13:32:11.544592Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:54.516468Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:4e488a9f3bdbca92db59400fa0f600bf905ba5596b2e7bfe30488d52d80807ce","observation_id":"4e20ecf2-a14a-4eec-9edc-ab8728858d75","resolution":{"observed_at":"2026-08-04T06:25:54.516468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2604.09107","last_updated":"2026-04-10T08:40:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-10T08:40:56Z","title":"TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:33.020610Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2604.09107"},"observation_digest":"sha256:7c9222f96cb23b391aec33e03badad0d0da57ec78c11220bc0babd0297ff333c","observation_id":"ee4ba978-e8d1-489f-b615-3c4137c3991b","resolution":{"observed_at":"2026-05-11T07:11:00.631266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2604.26256","last_updated":"2026-04-29T03:25:36Z","snapshot_observed_at":"2026-07-06T23:11:57.238808Z","submitted_at":"2026-04-29T03:25:36Z","title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T13:49:26.560459Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2604.26256"},"observation_digest":"sha256:4bb8bb017c573c266236ac703e6b6e5476b79299f5af2780e38dd2a1bd2e70c7","observation_id":"e6ba9bdf-05e5-4cc8-8ccf-873d988d8145","resolution":{"observed_at":"2026-05-12T08:46:26.425646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2605.19425","last_updated":"2026-05-19T06:23:43Z","snapshot_observed_at":"2026-08-02T09:08:38.988629Z","submitted_at":"2026-05-19T06:23:43Z","title":"When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T07:31:23.194325Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2605.19425"},"observation_digest":"sha256:18d93593ac77ef0efc862e48e7b3ae1ac280194c81408ba60c493a7176bb7c4e","observation_id":"3521626d-9bfb-47d7-924e-d54365baccd4","resolution":{"observed_at":"2026-05-20T07:33:07.364766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2605.26606","last_updated":"2026-05-26T06:41:13Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T06:41:13Z","title":"Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T19:47:09.817243Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2605.26606"},"observation_digest":"sha256:f5181af5fc57157115543c516855251c3d77b2103af1be6a994ad82d792e06f3","observation_id":"3ca7aa93-bd09-4601-9abd-9e0159acd6aa","resolution":{"observed_at":"2026-06-29T19:53:55.792604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2606.03077","last_updated":"2026-06-10T06:28:18Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:09:13Z","title":"Libra: Efficient Resource Management for Agentic RL Post-Training","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:00.385932Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2606.03077"},"observation_digest":"sha256:9c786fd1b2af4ea0cb1c5bd944f43927b8b6944d35fa23155bb3f9f22094b4c4","observation_id":"cda6d2b5-4d4e-4fcb-9c45-e253884a7721","resolution":{"observed_at":"2026-07-02T02:16:27.151232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2606.04560","last_updated":"2026-06-04T06:53:10Z","snapshot_observed_at":"2026-08-08T02:18:13.870572Z","submitted_at":"2026-06-03T07:47:47Z","title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T07:43:21.284574Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2606.04560"},"observation_digest":"sha256:18e4a722e3a2cd963813fc5b08215ca2f8bafdbcb289aafedefe106c54e4bcbf","observation_id":"1a77efd9-f915-4fbb-b87c-7876560eb8d5","resolution":{"observed_at":"2026-07-02T06:06:41.077555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2606.05597","last_updated":"2026-08-07T17:58:32Z","snapshot_observed_at":"2026-08-10T22:11:49.470153Z","submitted_at":"2026-06-04T02:18:44Z","title":"AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T02:45:25.694378Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2606.05597"},"observation_digest":"sha256:397a65f265afc11a5255f286293b09df141222be6e0dc60fb66a678b7ce7b5d1","observation_id":"9394f3ea-be4d-41d8-a70f-3022c8445dcc","resolution":{"observed_at":"2026-07-02T11:56:55.543867Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2606.08446","last_updated":"2026-06-07T04:24:45Z","snapshot_observed_at":"2026-08-05T08:26:57.919131Z","submitted_at":"2026-06-07T04:24:45Z","title":"Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T19:10:53.882876Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2606.08446"},"observation_digest":"sha256:e50d5e89f1f69cb4268b7ac2645b427bdfea72ed0107a1a50dfb2bc6d27c652c","observation_id":"2f99b87d-9796-49cc-ab6b-9a492c5824bc","resolution":{"observed_at":"2026-07-02T22:07:26.505309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"cited_work":{"arxiv_id":"2505.24034","doi":"10.48550/arxiv.2505.24034","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LlamaRL: A distributed asynchronous reinforcement learning framework for efficient large-scale LLM trainin","venue":"ArXiv.org","work_id":"30be0a58-f9a7-40ed-a0c6-c41bf00252bc","year":2025},"citing_paper":{"arxiv_id":"2606.11867","last_updated":"2026-06-10T09:42:11Z","snapshot_observed_at":"2026-07-06T23:50:53.469137Z","submitted_at":"2026-06-10T09:42:11Z","title":"Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T08:35:16.435272Z"},"links":{"cited_paper":"/paper/2505.24034","citing_paper":"/paper/2606.11867"},"observation_digest":"sha256:aad03db518fcc926706b10bcd2c137a88e4eedd5a09a8f3b39b4c29539325b7d","observation_id":"a9cd52f0-5201-422d-9aed-8d6667281aaa","resolution":{"observed_at":"2026-07-03T12:58:08.711158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24034/citation-record","integrity":"/paper/2505.24034/integrity","json":"/paper/2505.24034/citation-record.json","paper":"/paper/2505.24034"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:23.770147Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:23.770147Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:338181e9e36a2f888a4d1249e114615a03833c12229697beea8d774d0baa0625","observation_id":"07a64a7c-f311-4425-bb11-eeedc2081e68","resolution":{"observed_at":"2026-08-07T12:45:23.770147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:23.846339Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:23.846339Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:c9d9247f645cbf306bd8bf77850a5889002ab58ba97e6fa97077d08ab286da71","observation_id":"5de36d5c-a3cd-4aa9-90c9-651ae928d77b","resolution":{"observed_at":"2026-08-07T12:45:23.846339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:23.965479Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:23.965479Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:0e101a10440029490d20639babef79ae5b68a7fbb96252d0082a63732f9b1490","observation_id":"d22a7033-1274-48b7-8a45-d975a962a426","resolution":{"observed_at":"2026-08-07T12:45:23.965479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:24.134180Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.134180Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:9f12ea5f0e44101f6562767a8abe2b790bbe3ee634d9f0828ccd3987dd40cc2e","observation_id":"db16a862-1b80-41a8-9618-463fc606670b","resolution":{"observed_at":"2026-08-07T12:45:24.134180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:35.657289Z","title":null,"venue":null,"work_id":"3da87626-d582-4883-8198-803fc356c47c","year":null},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.271441Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:5fe00bae6d2fada19c598b3a90af5543e6e42ec068c1fc26b5f5dc16bcbc71bc","observation_id":"ead16030-8ce3-407b-bd40-d766dac12bad","resolution":{"observed_at":"2026-08-07T12:45:35.730570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T12:45:24.334354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.334354Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:ad29e9547cde207c7008175bb7ba147d042af6d7919e713229a18b65a6d8fb6f","observation_id":"45ff0517-193d-4dfa-b1a2-c1db99266a2e","resolution":{"observed_at":"2026-08-07T12:45:24.334354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:35.520114Z","title":"Claude: Training helpful and harmless ai assistants","venue":null,"work_id":"d4791e93-05e1-48b7-875d-166ba5c6109b","year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.414307Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:957f8084b5ff74435048ba2e385ba81f12df101e40b5b4c484a35d7b2ac6da44","observation_id":"f59b1836-af27-4c24-b324-e07d94e6bd63","resolution":{"observed_at":"2026-08-07T12:45:35.556691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T12:45:24.561905Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.561905Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:e248cfd22258cab419e632387f1a0f7faeee5c053d8d1aaeb16d4b3ed65ae9a8","observation_id":"989c91bd-78b9-4040-b10a-bb580ba78bd7","resolution":{"observed_at":"2026-08-07T12:45:24.561905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-07T12:45:24.616677Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.616677Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:73daa658d78ac835ffdcdb5b56bc63dda9860b52a79451510ebb2204a747068e","observation_id":"a392faf4-81bc-4a94-be1f-07e9a06b1d61","resolution":{"observed_at":"2026-08-07T12:45:24.616677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:24.670104Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.670104Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:65362780c5a5d981b810b2ecdf0537dd45a5f03641941cf7d9445962d4cb0f64","observation_id":"0217a153-b800-41d8-b2dc-6a03a2008b5f","resolution":{"observed_at":"2026-08-07T12:45:24.670104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:35.357454Z","title":null,"venue":null,"work_id":"5a7a7173-2831-4eba-a3ca-10b99210812b","year":2014},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.737131Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:6744484052f4b2fd52bf88b81543fd321cf62f793339d80bc4bd4f7f1da74b24","observation_id":"9eca5e5f-1329-4d86-8666-7011d054086a","resolution":{"observed_at":"2026-08-07T12:45:35.436611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:35.185220Z","title":null,"venue":null,"work_id":"1f5af0cd-709d-4fcb-b1be-4f3d2851481b","year":2017},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.830347Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:9e4baff7d67b2ff5c92b70ed4ea1ec535c2eab45bc2cb77ca772ddb31ec80da5","observation_id":"e5c9a32b-14a1-4940-bb45-0c8e9d9623c9","resolution":{"observed_at":"2026-08-07T12:45:35.249352Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:45:24.928868Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:24.928868Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:681991e07ccbb8ba162c4c372f3a58ab88b7d1618a99b79cef4457d3d4515c10","observation_id":"b94aa1bd-1675-437b-b240-bc9492c67b0d","resolution":{"observed_at":"2026-08-07T12:45:24.928868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:45:25.046427Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.046427Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:5d9f6c9e5425ad938c80366daab6ab2397b8aad234aef4860c2587985c6795c0","observation_id":"11693588-6706-486d-be96-698d8782eec0","resolution":{"observed_at":"2026-08-07T12:45:25.046427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-08-07T04:02:54.504761Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06767","snapshot_observed_at":"2026-08-07T12:45:25.186917Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.186917Z"},"links":{"cited_paper":"/paper/2304.06767","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:4628c6f0d347e8cc359d4ecc6aee2f6f9204f858a9982471ee9cbe554bdf3a2d","observation_id":"f5e39292-d015-48f7-834a-6d8d9c80605f","resolution":{"observed_at":"2026-08-07T12:45:25.186917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-10T16:13:21.623732Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T12:45:25.443666Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.443666Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:47546cca45fcbf020e6216d76116120099b9abc6618ca50c9aa780d071c5ba3c","observation_id":"e708a75c-3b4d-428f-943b-9da9ad7ccb01","resolution":{"observed_at":"2026-08-07T12:45:25.443666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:34.996670Z","title":null,"venue":null,"work_id":"389f25d8-5ff8-4b13-96cd-f332261b82dd","year":2018},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.543781Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:2e56528a29913a33cdc44e68ce9cb6058b99f1516fa25984fbd5348ff03d4379","observation_id":"b256365c-8f1c-482a-b6ee-372103d1a48e","resolution":{"observed_at":"2026-08-07T12:45:35.084914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T12:45:25.658504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.658504Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:e1e77df19cef250caf14f58c5f094cf95fdfd216355cf477c463c942710da59c","observation_id":"1aff602b-b69d-462f-8792-7d66865a4e5d","resolution":{"observed_at":"2026-08-07T12:45:25.658504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:34.809436Z","title":"Bard: Conversational ai by google","venue":null,"work_id":"afefc134-2bd1-4671-a0a3-0056be0d81db","year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.746481Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:72a9738a5bd34286241adc5edbfcda2ab30f597153486f126afdc3383ef4c3a8","observation_id":"41064d76-6cec-4431-99ca-ac9028e20ae3","resolution":{"observed_at":"2026-08-07T12:45:34.891145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:45:25.860418Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.860418Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:774cec920b8680625c14bdd8c79203561f6ce0642781787189f5661d5a7c78c4","observation_id":"73fccd74-5a99-4ea2-acf7-9c161fd76513","resolution":{"observed_at":"2026-08-07T12:45:25.860418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T12:45:25.995232Z","title":"X., and Steinhardt, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.995232Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:cb5833937e39e33c01620aa0066b5d118da63181438815e3d18a709a99e7b9f4","observation_id":"5f7c0837-28d7-4e25-9eba-81eca24608ef","resolution":{"observed_at":"2026-08-07T12:45:25.995232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-07-06T06:12:18.811024Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-07T12:45:26.107786Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.107786Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:1f66085828990f246f224a9ed4dd06f329a952196dbff4c5be032f4488a7ebd5","observation_id":"2128733f-0124-4d36-8e3d-4cdc5e9d507b","resolution":{"observed_at":"2026-08-07T12:45:26.107786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T12:45:26.228541Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.228541Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:ae12024aa018b0e274d9cce1ab0195c5c56f02c1f61b884755279076f014aa7e","observation_id":"e19f7d38-bb19-49ea-a33f-163005cb279f","resolution":{"observed_at":"2026-08-07T12:45:26.228541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:34.636826Z","title":null,"venue":null,"work_id":"97fd1c0b-f7ef-47b6-b991-d0f7e663d45e","year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.309987Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:b419d8958ba83fc471e5b5f0266cdc0a65ed3562c409222c0c3b2d7c83006bf9","observation_id":"59cc2812-bd55-49a7-89d5-b1bd41a21eeb","resolution":{"observed_at":"2026-08-07T12:45:34.707529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T12:45:26.395468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.395468Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:b3e892c62d2ed7e55cef20e9e7c8a2cfc4fa2eaf6eff9ac290c6460499fb2f02","observation_id":"c25dc515-d9e1-49fa-a8cb-a386905f912e","resolution":{"observed_at":"2026-08-07T12:45:26.395468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:34.498082Z","title":"and Abbeel, P","venue":null,"work_id":"ce1c1892-484c-4ab4-a75a-52eb7ea33212","year":2010},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.446359Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:90b0dcad8ceb54c794cedc7e0dec23dd9fe0e1e46ad11d65c7707e9014a52432","observation_id":"2d545a37-25e9-4084-93c2-11c1aa9bb837","resolution":{"observed_at":"2026-08-07T12:45:34.582388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:34.343641Z","title":"and Langford, J","venue":null,"work_id":"7ac5941b-f6ca-4864-885a-de313e61edee","year":2002},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.503995Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:d778b2fc202cb49aeed771820fcad47cc31773e9846baab4404fec3b7a00050f","observation_id":"52141ded-4384-4fbb-bf54-6370bb16020e","resolution":{"observed_at":"2026-08-07T12:45:34.404114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T12:45:26.558951Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.558951Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:f24922e628e163bf5ea522900d1152fc90533607e56107a27642fd01a9667cbb","observation_id":"c25ab529-3f3d-466c-8630-6f9e046841cd","resolution":{"observed_at":"2026-08-07T12:45:26.558951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:34.228762Z","title":null,"venue":null,"work_id":"54ee8df8-e364-444e-9ac4-85f1e283f131","year":2018},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.611239Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:00573b8cf5b32c1e6566c95d9c72b57e7f2195ba920cc7441f296b207666dd48","observation_id":"3000b53c-46e7-4d71-b723-93897e3a6536","resolution":{"observed_at":"2026-08-07T12:45:34.275455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T12:45:26.663718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.663718Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:c8a629d1392a57d44a113a9460a7d4ad1ddb3e24d0e3372e3f543c2c87515924","observation_id":"5139bbd4-11cc-4431-be00-5e305202204e","resolution":{"observed_at":"2026-08-07T12:45:26.663718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-10T17:28:59.378726Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T12:45:26.712582Z","title":"Kimi k1.5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.712582Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:ca34ad33f5429e716d3ad0e31a3b948f577ca4d30a5e6afc939eefdae5524003","observation_id":"4d97c8bf-a410-47c1-abd8-07a60b8739b7","resolution":{"observed_at":"2026-08-07T12:45:26.712582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T12:45:26.768253Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.768253Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:ddcc7de18b080ea7fa88ffe959ef527717e075688c5151840b202d632e62c49a","observation_id":"5ed95391-f60b-442b-a38c-da2cd65d4524","resolution":{"observed_at":"2026-08-07T12:45:26.768253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T12:45:26.809054Z","title":"D., Pyatkin, V., Huang, S., Ivison, H., Brahman, F., Miranda, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.809054Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:2a4eea4905f5df5d9a29ab2d3e3923f6469fb869998a48097d629309609648bd","observation_id":"85c1a2e6-39ea-4fae-a9e7-0fe0007ea9c1","resolution":{"observed_at":"2026-08-07T12:45:26.809054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:34.133573Z","title":"G., Park, J","venue":null,"work_id":"0f5e97c1-9f40-47b3-9a52-b5c42e6102b2","year":2014},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.854355Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:63fa7e65074ada39ef94b6f125a08d2744e8432f16d26c928ad94bae26cd4ded","observation_id":"baf38e29-692f-47ad-a007-0a6dfa798140","resolution":{"observed_at":"2026-08-07T12:45:34.179070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:34.016247Z","title":null,"venue":null,"work_id":"7013e544-57b7-4af9-a292-16793d741c11","year":2022},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.901233Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:fac27d91fa08ed9b93aefa651d90d9d89211b3883dc643b4254dd5bc2eb040f5","observation_id":"8d3eb950-d117-4390-b03a-00a18af5e0d2","resolution":{"observed_at":"2026-08-07T12:45:34.060963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:33.908571Z","title":null,"venue":null,"work_id":"14012009-fb5b-40ea-b4de-b4d7e29a74e1","year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.959962Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:e530725903b065c7c7d3b5b732a34fdf252f5f8cddbf08df5f585eeb2afdd559","observation_id":"629e7fe6-a2ae-4098-9814-c7fc615ab6e3","resolution":{"observed_at":"2026-08-07T12:45:33.950050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T12:45:27.040318Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.040318Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:7d445f3fa0def4b1ca0e5f3b0ef86dbd32891dd009a57519a6b6e9bce34e3a62","observation_id":"b2b022ba-afae-4eea-b518-3aae00c6c6f1","resolution":{"observed_at":"2026-08-07T12:45:27.040318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:45:27.098290Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.098290Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:41081c40ee2476c68458da029224f50f8468ff77a95a065f7f9d2f56e7b15129","observation_id":"759d7f3d-bc02-4068-8885-51aa739c7f6e","resolution":{"observed_at":"2026-08-07T12:45:27.098290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:45:27.144979Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.144979Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:5d990d61d7b41a403471133d7190c38ffadb97dcda65c46ec2df5cdc30b7c7c3","observation_id":"2ac4ad63-b16f-4bfc-9372-3147a3f164c1","resolution":{"observed_at":"2026-08-07T12:45:27.144979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:27.201064Z","title":"P., Paprocki, M., C ert\\' i k, O., Kirpichev, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.201064Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:4d80073b38c72783fb015a0cafa1f3637da4e629b41bc2797d09870543f2028f","observation_id":"753d3c29-85d2-4bb2-8f2b-8768ebdde0c3","resolution":{"observed_at":"2026-08-07T12:45:27.201064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:33.753636Z","title":"P., Mirza, M., Graves, A., Lillicrap, T., Harley, T., Silver, D., and Kavukcuoglu, K","venue":null,"work_id":"8b38ae4d-c606-4c62-8e51-5f369e71d064","year":2016},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.243910Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:192e3049df42ce3a0b62b7a68ced1164ad8aafc5df732d3b55a5eb28cac4a123","observation_id":"1b625d55-d532-4228-b7c6-1d331bebadd3","resolution":{"observed_at":"2026-08-07T12:45:33.815726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:33.646424Z","title":"I., and Stoica, I","venue":null,"work_id":"ec7082d2-9d36-4cba-a59e-e49b22110b44","year":2018},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.297791Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:7d939c56a487e313a9f4149307fea015e3efd5021022a0f6c0eb962f2ab4a00f","observation_id":"2ae4da01-07d6-4862-b8f6-c9fd40a544b0","resolution":{"observed_at":"2026-08-07T12:45:33.696311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:33.523466Z","title":null,"venue":null,"work_id":"97dc814e-8db8-452b-a009-51732a092c01","year":2016},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.353704Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:ef366f6a516f83366c566bcfd1c24718f647bcb29eee4883f6b8176a94d3f396","observation_id":"eca310e8-d82c-44cf-aaf6-aff43d74a587","resolution":{"observed_at":"2026-08-07T12:45:33.572033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:33.374806Z","title":"B., Singh, V., Lin, M., Gimelshein, N., Desmaison, A., and Yang, E","venue":null,"work_id":"63b94ce3-d623-4c19-bc41-ac961c2eb58f","year":2021},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.404939Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:4a3e95f1d1793d65c2ec13322b4f81d021c1778daf546c5dc5f83d18be364960","observation_id":"e0f34c75-af43-4eb7-afbc-39fa7ab6c496","resolution":{"observed_at":"2026-08-07T12:45:33.440164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:33.209306Z","title":null,"venue":null,"work_id":"2f45a279-3c7b-4762-8a60-f527992a09b2","year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.448474Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:2bc2fac177125fb13a2d64d408bd6e20516264c844f5a91f352aca318f10a063","observation_id":"9c42c152-03f6-416f-aa9e-44c0921b7bfc","resolution":{"observed_at":"2026-08-07T12:45:33.302036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:45:27.526241Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.526241Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:d5de7802af71be0e3d452e25f5225529e77df8476bf6f0ef0933855c598a45d0","observation_id":"e224529b-dd60-40be-972f-44b209a252f9","resolution":{"observed_at":"2026-08-07T12:45:27.526241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T12:45:27.595282Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.595282Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:a95c94fd170d17d26fdcad3bf11523d17877c4d3c99ccb03e0ab4bdb2f9c9a3e","observation_id":"49944a65-5e2f-4e27-9d42-68d438bdb65e","resolution":{"observed_at":"2026-08-07T12:45:27.595282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:33.119947Z","title":"and et al","venue":null,"work_id":"66713990-ad27-4249-bec6-6d6db29cd76f","year":2013},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.679104Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:ea5edbaae7d8274ffa7ff4586882321916e9c51256037ae869414e0647fdfc5f","observation_id":"2169cf50-ffc1-47c5-9777-6ed001b2056f","resolution":{"observed_at":"2026-08-07T12:45:33.167654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:33.006532Z","title":"S., and Singh, S","venue":null,"work_id":"0e2386ce-fc52-4e55-bfb2-a14cc24c5b26","year":2000},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.725997Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:848b83f5dc8ab4a3532cc84938f545f3d22ade1d2fbb3b2e0edaf19d2f34502e","observation_id":"e2749790-728d-4965-9cf0-94d6d3fc1d7c","resolution":{"observed_at":"2026-08-07T12:45:33.056767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:32.881592Z","title":null,"venue":null,"work_id":"b6be3926-e463-4380-a598-8a68c174975a","year":2019},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.813391Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:71f33aa5b3ed74a0ca9b40c9b8154039a77517e0f455b0bb152ef22177d745af","observation_id":"b2f0289c-d1e7-4be0-a362-40bab67b28cf","resolution":{"observed_at":"2026-08-07T12:45:32.959344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:32.769192Z","title":null,"venue":null,"work_id":"6c04e83d-4045-4aeb-9c92-2d5a4d92ee8d","year":2019},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.880640Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:e2ac44d86b60157516a98b4c84844d4e5d65a63b9d0f2279fa13898c28aa89cf","observation_id":"085e1425-1e98-4dbf-82c4-9f6528c057f5","resolution":{"observed_at":"2026-08-07T12:45:32.826777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:32.553931Z","title":null,"venue":null,"work_id":"f5c428a5-2bb6-45b6-b7eb-b79b772fef37","year":2020},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:27.990465Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:ca0cce86c471e60ccaa4d892a34d1706eca5c38be86ef91b3641822ab939be78","observation_id":"497bfe96-31bf-49da-b6e3-5dea5b5e6a9c","resolution":{"observed_at":"2026-08-07T12:45:32.650731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:32.335968Z","title":null,"venue":null,"work_id":"7aca191b-fe2f-419c-931c-3f4df9bf17a4","year":2015},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.113659Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:5936223307fff8d017de529ac21dbc9b047a345ab471877fb796fab43f6ad20c","observation_id":"2dabefd9-2f45-4bb8-86fe-7f6d9ef369d8","resolution":{"observed_at":"2026-08-07T12:45:32.433370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:45:28.227786Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.227786Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:74a380d0b6aaddce6313f212a45783b9f31935dde3097ca4a797a31a0edf62b1","observation_id":"0c3b2671-921c-4580-ba77-6cf25f206ba7","resolution":{"observed_at":"2026-08-07T12:45:28.227786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:45:28.335605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.335605Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:d37e9efd55c9701196e331b4968085cf6c76c0b3d2ffe71fc60d5425eccf51bb","observation_id":"b69a40a9-1ab4-438c-9e68-a9c91c601b4f","resolution":{"observed_at":"2026-08-07T12:45:28.335605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:32.156270Z","title":"S., Aithal, A., and Kuchaiev, O","venue":null,"work_id":"08b28167-82e8-4fed-a7c7-6095c8ff55a1","year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.486086Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:cc2dd5633ed741147518e931d6740227463ecca246baa1a55b5992ce5ebe530c","observation_id":"84f342ad-16dc-4c18-a48c-25f7d2a1a718","resolution":{"observed_at":"2026-08-07T12:45:32.250872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T12:45:28.605509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.605509Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:9d292633ba8b51c6d0ad334046945ea064a96a069d2b8c718b15d535ac29a9a2","observation_id":"a682b063-6ddc-4529-8a0f-2a2c1fb2c606","resolution":{"observed_at":"2026-08-07T12:45:28.605509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T12:45:28.702500Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.702500Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:c854e1e8e8878a9aa0a0046d0591ac7951924d148d3092d7ee159fd9339a8feb","observation_id":"0d72c3d2-2a49-4dfb-8db5-d2060873a8e9","resolution":{"observed_at":"2026-08-07T12:45:28.702500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-07T12:45:28.836184Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.836184Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:65be147f93383c2585e7a1a90d290d3b6d921f9f83eba379346437cfe8e74900","observation_id":"bd313a9f-5794-4dbb-9f22-8b1be12cc3de","resolution":{"observed_at":"2026-08-07T12:45:28.836184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:31.902226Z","title":null,"venue":null,"work_id":"9c530ef4-cc7a-40f3-a607-bf3a028a1720","year":2017},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.918413Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:2facc9ccb70a8689686a52a480693e7ede64dcb5786561bb0cb64983aabaa8db","observation_id":"29d07c9a-94ee-4274-a160-df653b7a835d","resolution":{"observed_at":"2026-08-07T12:45:31.985189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:31.723423Z","title":null,"venue":null,"work_id":"c0097b2f-6824-45e6-ac4b-fda240e8675b","year":2020},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:28.973764Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:cf7a1ee57b89b992c6558a471977298acb8a0c069c6cd68af800af65aa56f173","observation_id":"2591cb05-32c7-4872-831e-d37cb3368112","resolution":{"observed_at":"2026-08-07T12:45:31.792103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:45:29.052265Z","title":"M., Hauth, A., Millican, K., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.052265Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:2915feeb5edccca80eb76e3e19899fd0060cf802b068884cbfa685ddbe157f80","observation_id":"40392732-00a9-4837-8ca2-61d1d0092168","resolution":{"observed_at":"2026-08-07T12:45:29.052265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:31.551733Z","title":null,"venue":null,"work_id":"97363cf6-d163-4fb7-863c-53927957ed58","year":2019},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.206789Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:13fe874e3de965f94e43ebfda0524e88b30649ef6e4b40282a09c63edc82dfba","observation_id":"a060fd00-2d23-4b38-929f-5030ff16084f","resolution":{"observed_at":"2026-08-07T12:45:31.620568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:45:29.254014Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.254014Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:30c08431d0d135beb6a14fed6f7cb6591ff4fd9177410d89f0cff8ca120f79ba","observation_id":"7239647a-83cb-4ef0-bb04-9746ced809ca","resolution":{"observed_at":"2026-08-07T12:45:29.254014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T12:45:29.295485Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.295485Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:259f4c385f13017eb99ce757de94607612432187a12fd84ba0fcf7832dd3ccad","observation_id":"0e9e40be-f8b0-41bc-9414-010bce4df230","resolution":{"observed_at":"2026-08-07T12:45:29.295485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:31.368241Z","title":"M., Dudzik, A., Huang, A., Georgiev, P., Powell, R., et al","venue":null,"work_id":"377ebbf1-4b15-4013-b987-ab3b37877634","year":2019},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.338170Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:cfcb410224b5bbf338dbe6fcb79f8286b52dbce5c036b2d4e60f3d8d12092916","observation_id":"a39cd7e0-210c-44cd-9ec5-768f76a8034e","resolution":{"observed_at":"2026-08-07T12:45:31.458469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01224","last_updated":"2017-07-10T14:38:10Z","snapshot_observed_at":"2026-08-10T11:54:22.061417Z","submitted_at":"2016-11-03T23:21:32Z","title":"Sample Efficient Actor-Critic with Experience Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01224","snapshot_observed_at":"2026-08-07T12:45:29.387646Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.387646Z"},"links":{"cited_paper":"/paper/1611.01224","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:b56c6a04422053eb2b22e5157c5156827c765b41d1ce11f7e190c4e2ff5a9904","observation_id":"81515745-7875-4b0b-8e5c-5ced99f458a4","resolution":{"observed_at":"2026-08-07T12:45:29.387646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T12:45:29.562365Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.562365Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:3fc4fe9941bcc9ee68eccb2ce291e26f78966ddbd6176b13fd9c683996268f10","observation_id":"8f639335-f82c-48d5-a3be-fdd1be02f552","resolution":{"observed_at":"2026-08-07T12:45:29.562365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11819","last_updated":"2024-10-14T11:57:00Z","snapshot_observed_at":"2026-07-06T17:05:02.853583Z","submitted_at":"2023-12-19T03:24:55Z","title":"An Adaptive Placement and Parallelism Framework for Accelerating RLHF Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11819","snapshot_observed_at":"2026-08-07T12:45:29.683650Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.683650Z"},"links":{"cited_paper":"/paper/2312.11819","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:19abfe007f17fbcc133277ca325abba204dfc6e78f9696c71577eccbb41e46ba","observation_id":"9bb2f068-38ab-4814-b125-249b1d0199b6","resolution":{"observed_at":"2026-08-07T12:45:29.683650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:31.214826Z","title":"A., Jin, D., Peng, K., Han, E., Nie, S., Zhu, C., Zhang, H., Zhou, W., Zeng, Z., He, Y., Mandyam, K., Talabzadeh, A., Khabsa, M., Cohen, G., Tian, Y., Ma, H., Wang, S., and Fang, H","venue":null,"work_id":"2331a45d-3e50-4ed9-9b28-556f00a4ee5e","year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:29.826054Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:12df937b5184d41140863623b3fdc64896b8785dbcaf6dcc66fba6886ffdd22c","observation_id":"0486456e-f3ee-40a1-9652-95381310eb25","resolution":{"observed_at":"2026-08-07T12:45:31.278750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:30.989538Z","title":"Y., Ruwase, O., Rajbhandari, S., Wu, X., Awan, A","venue":null,"work_id":"7c3459dd-ff00-4416-9776-6de20c95378b","year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:30.031519Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:8097a6d7a94eda93adc89448b9dc77e07f1c869464c8f326d5d0f19e626ce609","observation_id":"46341aad-f537-46d2-8202-9159ac88dfac","resolution":{"observed_at":"2026-08-07T12:45:31.128954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17193","last_updated":"2024-02-27T04:18:49Z","snapshot_observed_at":"2026-08-10T16:54:55.723491Z","submitted_at":"2024-02-27T04:18:49Z","title":"When Scaling Meets LLM Finetuning: The Effect of Data, Model and Finetuning Method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17193","snapshot_observed_at":"2026-08-07T12:45:30.128496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:30.128496Z"},"links":{"cited_paper":"/paper/2402.17193","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:dff4f2dd2fd6f70ad1f1804ed4bf9cd526727ad94d0c541d07f8e3d0e88301fb","observation_id":"7010431b-99de-49de-b0f4-33e42bccc211","resolution":{"observed_at":"2026-08-07T12:45:30.128496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:30.841251Z","title":null,"venue":null,"work_id":"c3c7145d-1df4-49cb-b187-c109b6043b55","year":2023},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:30.191698Z"},"links":{"citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:becb671203f3dc11469feecea163628568318bf2b154495e670f98727dd302f1","observation_id":"8648f7e9-c63d-4282-9317-11333bb0cad1","resolution":{"observed_at":"2026-08-07T12:45:30.901240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T12:45:30.237588Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:30.237588Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:4f2592158f30d52869d4a1259b333027dc8c29e0ad8fefd1c04e9cd2254ad932","observation_id":"4944aca5-0cd3-4705-aef9-659817159aaf","resolution":{"observed_at":"2026-08-07T12:45:30.237588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 14 inbound Pith citation observations for arXiv:2505.24034."}