{"as_of":"2026-08-20T12:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b1eec14c4473b5a2e56745407a2ae88566102ad220d8f8c2eae5984f57b852a","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":132,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":132,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":82,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:33:19.537525Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":191,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:05c8aad864c635ee56da8afdeebfc8dfd283fee883650612e6b5756e107260ad","observation_id":"82ad9e0a-fd61-4bad-ad06-681f30b30f8b","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-16T12:27:55.152640Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:ae7c1d5b6be0c66635a4d7c794e39166e4b32208389f7cfa8e907217f9d6519b","observation_id":"87c5e038-0a6d-4e4b-b4a3-bd42cce82f05","resolution":{"observed_at":"2026-05-22T19:32:01.288940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-16T12:33:19.537525Z","title":"AReaL: A large-scale asynchronous reinforcement learning system for language reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-16T12:27:55.152640Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":11},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-08-16T12:33:19.537525Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:3c4802088cbe4c4f4c10fadcc64b14606c468110dec0ae45dca05eddc84840c3","observation_id":"40d20f02-e5b1-4689-b35d-b4082c9cecc2","resolution":{"observed_at":"2026-08-16T12:33:19.537525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-06T22:01:23.648438Z","title":"arXiv:2505.24298 [cs.LG] https://arxiv.org/abs/2505.24298","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22950","last_updated":"2025-06-28T16:52:29Z","snapshot_observed_at":"2026-08-16T18:40:53.708179Z","submitted_at":"2025-06-28T16:52:29Z","title":"Infinite Sampling: Efficient and Stable Grouped RL Training for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:23.648438Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2506.22950"},"observation_digest":"sha256:d7491e04486763882837a48ad04c70224301801015fae1b32f62e1ff6e7d5e73","observation_id":"91e4a796-2636-4899-b357-0aaf145a915b","resolution":{"observed_at":"2026-08-06T22:01:23.648438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-06T20:50:23.494922Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-13T08:22:12.599337Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.494922Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:7f0b34e294353c3e170cc29b03305346b91f51a68cd70ff50d36912a38c08c38","observation_id":"25fd9d1c-33a4-4ccf-a6da-17df1b42fefa","resolution":{"observed_at":"2026-08-06T20:50:23.494922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-06T19:20:53.303978Z","title":"url: https://arxiv.org/abs/2505.24298","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05934","last_updated":"2025-07-08T12:34:10Z","snapshot_observed_at":"2026-08-18T09:54:13.966217Z","submitted_at":"2025-07-08T12:34:10Z","title":"BlueLM-2.5-3B Technical Report","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:20:53.303978Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2507.05934"},"observation_digest":"sha256:c009a1ae56cd8e6af529b2716ab39dcc7923d89c80f15ebaa7da02fb53414213","observation_id":"f0f1af5d-8ee7-4d5c-b13e-b8847f51641e","resolution":{"observed_at":"2026-08-06T19:20:53.303978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-15T18:07:34.964925Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19017","last_updated":"2025-07-25T07:11:49Z","snapshot_observed_at":"2026-08-19T06:36:45.292994Z","submitted_at":"2025-07-25T07:11:49Z","title":"MindSpeed RL: Distributed Dataflow for Scalable and Efficient RL Training on Ascend NPU Cluster","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:34.964925Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2507.19017"},"observation_digest":"sha256:48e9fd23182884c26c6cb5c13bb1376100c89ab2865047121ee3157b894d0805","observation_id":"89ad4549-b54c-490c-b514-75a11640561b","resolution":{"observed_at":"2026-08-15T18:07:34.964925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-06T04:17:54.142833Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-15T03:48:34.730767Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T04:17:54.142833Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2508.03680"},"observation_digest":"sha256:7d2b426e16b5cf8bcefd3168b93913915dcb85e52e9a3c1650965393181ee472","observation_id":"c27dc36d-5ebe-46fa-ab14-4e34213b8488","resolution":{"observed_at":"2026-08-06T04:17:54.142833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-15T17:22:55.370681Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12790","last_updated":"2025-08-18T10:06:08Z","snapshot_observed_at":"2026-08-16T01:56:40.345082Z","submitted_at":"2025-08-18T10:06:08Z","title":"Reinforcement Learning with Rubric Anchors","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:22:55.370681Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2508.12790"},"observation_digest":"sha256:88365e37dcb69dcf1891b8638e5b8f333a82e13ca4a302d4428c1402f68b226f","observation_id":"00e6d183-f73c-4242-bcad-ac5f48f1fa04","resolution":{"observed_at":"2026-08-15T17:22:55.370681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-15T17:01:18.391862Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18588","last_updated":"2025-08-26T01:42:46Z","snapshot_observed_at":"2026-08-15T22:53:41.767148Z","submitted_at":"2025-08-26T01:42:46Z","title":"History Rhymes: Accelerating LLM Reinforcement Learning with RhymeRL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:01:18.391862Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2508.18588"},"observation_digest":"sha256:9e4848acc211c1e9e6db6f99d6074aa8c56c9526e94d0594c8465d307d4b20b9","observation_id":"6f41e1d7-81c2-45b0-86d8-93f1976f96a8","resolution":{"observed_at":"2026-08-15T17:01:18.391862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T15:10:17.779979Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20404","last_updated":"2025-09-01T03:56:31Z","snapshot_observed_at":"2026-08-19T05:34:20.662064Z","submitted_at":"2025-08-28T04:04:30Z","title":"AWorld: Orchestrating the Training Recipe for Agentic AI","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:10:17.779979Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2508.20404"},"observation_digest":"sha256:f969862ab77cc7c3e29e753fcf09112edb28154be34d0b416ed82b5d600dfdfe","observation_id":"0525c134-88c7-4d1a-a5e2-4c201a03f947","resolution":{"observed_at":"2026-08-05T15:10:17.779979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-15T16:11:38.042144Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08721","last_updated":"2025-09-10T16:14:20Z","snapshot_observed_at":"2026-08-18T23:58:08.466928Z","submitted_at":"2025-09-10T16:14:20Z","title":"Sharing is Caring: Efficient LM Post-Training with Collective RL Experience Sharing","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:38.042144Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2509.08721"},"observation_digest":"sha256:63de1065a30403c1ef2e021fe49a9adbf4a4ba19c792328ad25d9ed0b39a8b84","observation_id":"e6c60293-83df-4036-8035-987740f8026c","resolution":{"observed_at":"2026-08-15T16:11:38.042144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:a789d8c681234b50d09a1bbff57aac426f3a740727dde7d37f03bdb9824a9719","observation_id":"8011cfc6-c1fd-46e9-a2f6-a47513364950","resolution":{"observed_at":"2026-05-18T00:02:25.401254Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T16:07:29.199481Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-15T19:34:29.390362Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.199481Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:38efe4ad5e54aaee1b9a301014b4b15566fa74297d08017201ca0b8bdb17def1","observation_id":"d8d6583d-a411-4896-ac62-6ef44ab2e356","resolution":{"observed_at":"2026-08-04T16:07:29.199481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T10:50:09.254400Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning.arXiv preprint arXiv:2505.24298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.08525","last_updated":"2026-05-27T17:54:39Z","snapshot_observed_at":"2026-08-17T19:07:17.331357Z","submitted_at":"2025-10-09T17:50:00Z","title":"Which Heads Matter for Reasoning? RL-Guided KV Cache Compression","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:50:09.254400Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2510.08525"},"observation_digest":"sha256:7e4859c260d2f4e584c71811d941231ce8142846d502fc49ee8da0f69b3dd4a5","observation_id":"413d2afd-76e0-4a29-bcf6-2e2cd3ca6ef8","resolution":{"observed_at":"2026-08-04T10:50:09.254400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T10:39:26.538300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09388","last_updated":"2026-06-22T08:02:17Z","snapshot_observed_at":"2026-08-17T15:55:41.929930Z","submitted_at":"2025-10-10T13:42:03Z","title":"Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:39:26.538300Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2510.09388"},"observation_digest":"sha256:0c49e4458d8416d1a627282b1a44e316837e7df99d6576b2f5fa578e527168b0","observation_id":"8f02a984-a9be-4d4e-a564-8ec48c2572e0","resolution":{"observed_at":"2026-08-04T10:39:26.538300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-08-15T07:55:54.310165Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:cc3c3626a5e144cf457032d88ab6251f6b0d09bfc1ed2c4e0f23098612faedd8","observation_id":"dfc8bfee-2973-4ef5-ac6b-aeaf4c5df871","resolution":{"observed_at":"2026-05-18T05:30:55.176765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-08-16T08:02:43.077398Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T20:38:30.169363Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2511.14617"},"observation_digest":"sha256:4e61e07a103e9bee16c32e9a545ee4eba506326b2669d6ee9824d0dfa4050d42","observation_id":"4bee1411-9875-4874-9e6f-8841b42ac7a5","resolution":{"observed_at":"2026-05-17T20:40:14.640754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2512.12476","last_updated":"2026-04-11T14:05:07Z","snapshot_observed_at":"2026-08-20T04:35:10.745840Z","submitted_at":"2025-12-13T22:20:51Z","title":"HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-16T22:21:26.271796Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2512.12476"},"observation_digest":"sha256:982635d575f79cc7a73669b311040976ccbe26546ab8607ebafefc7f6a006b7d","observation_id":"aacc2d48-dda8-4a96-a6ab-3f900befb151","resolution":{"observed_at":"2026-05-16T22:23:36.646232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T11:08:09.185820Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.07376","last_updated":"2026-07-06T09:21:40Z","snapshot_observed_at":"2026-08-13T21:51:52.494850Z","submitted_at":"2026-01-12T09:57:46Z","title":"OpenTinker: Separating Concerns in Agentic Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T11:08:09.185820Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.07376"},"observation_digest":"sha256:7d2f03e1b993757856ede768a54c791a3e86218ada0befed1bf10c3a9c2be9e3","observation_id":"70d7ed3e-a225-46ab-9638-255e8247c743","resolution":{"observed_at":"2026-08-03T11:08:09.185820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-04T06:25:47.347729Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-14T11:51:35.909166Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.347729Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:4d9c39998c9cd764913c2a6f256c9415db8e95da416e4ab732eae85543578dbb","observation_id":"7d2d5ef5-381b-41af-b18b-44f0ae5fc23f","resolution":{"observed_at":"2026-08-04T06:25:47.347729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T09:01:48.820681Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning.arXiv preprint arXiv:2505.24298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15141","last_updated":"2026-07-03T06:13:09Z","snapshot_observed_at":"2026-08-18T20:35:12.213027Z","submitted_at":"2026-01-21T16:14:30Z","title":"CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:01:48.820681Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.15141"},"observation_digest":"sha256:71eccb57f317d0dc8987f15795ca8ba176f491f04a3f98e8cc7af700925f5085","observation_id":"bbaf49e3-f50a-4ba9-8bc2-a838fd1b49c6","resolution":{"observed_at":"2026-08-03T09:01:48.820681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2601.18150","last_updated":"2026-04-10T15:41:56Z","snapshot_observed_at":"2026-08-12T12:09:18.490120Z","submitted_at":"2026-01-26T05:12:05Z","title":"FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T11:07:18.839899Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.18150"},"observation_digest":"sha256:11cd6a73dabf475d344420a3d064105ff006a78f643dfc189db3e2aee218407b","observation_id":"26e97cb3-bbe2-4ffc-aa2d-49d925b892c4","resolution":{"observed_at":"2026-05-16T11:07:47.092261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T07:01:12.356383Z","title":"Kanishk Gandhi, Ayush Chakravarthy, Anikait Singh, Nathan Lile, and Noah D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.21476","last_updated":"2026-07-08T14:57:44Z","snapshot_observed_at":"2026-08-18T09:14:54.542173Z","submitted_at":"2026-01-29T09:56:15Z","title":"Thinking Seeds: Leveraging Historical Diversity for Position-Aware RL in LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T07:01:12.356383Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.21476"},"observation_digest":"sha256:265da9b3945b067713f47c695af5cc14621553fd3f3bbef7b156943339c8f080","observation_id":"eee55e6b-5056-48fa-a879-7ed6a6f470ef","resolution":{"observed_at":"2026-08-03T07:01:12.356383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-15T00:04:59.012652Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T09:37:57.120779Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:64f8d92032396a75a87d6d2b77a858291c5476d15a54fc2e76542b5ef411c817","observation_id":"7c0d5b6e-5517-449d-bb89-e4a7f943ed09","resolution":{"observed_at":"2026-05-16T09:40:49.102585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2601.21484","last_updated":"2026-05-19T09:15:43Z","snapshot_observed_at":"2026-08-15T00:04:59.012652Z","submitted_at":"2026-01-29T10:06:52Z","title":"ETS: Energy-Guided Test-Time Scaling for Training-Free RL Alignment","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T14:05:37.120262Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2601.21484"},"observation_digest":"sha256:e6c512834a1b04b93462b5fdbdfe502730df2ecd57eccd9c60af1e2234e4e0b8","observation_id":"4c092ba1-561c-46a3-a115-ae396192aaa4","resolution":{"observed_at":"2026-05-21T14:10:13.456057Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-03T05:32:40.837833Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning.arXiv preprint arXiv:2505.24298, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02192","last_updated":"2026-05-26T02:43:34Z","snapshot_observed_at":"2026-08-19T19:06:03.935321Z","submitted_at":"2026-02-02T14:57:53Z","title":"ECHO-2: A Large-Scale Distributed Rollout Framework for Cost-Efficient Reinforcement Learning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T05:32:40.837833Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2602.02192"},"observation_digest":"sha256:927e44e27d21b52a289b23d2207864291f481c850b12fafe9b5bef2d7c6617af","observation_id":"af19c22a-1aa9-4c5b-87fb-42df5799b123","resolution":{"observed_at":"2026-08-03T05:32:40.837833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2602.05765","last_updated":"2026-04-07T08:14:29Z","snapshot_observed_at":"2026-08-15T04:19:25.226738Z","submitted_at":"2026-02-05T15:30:23Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T07:01:54.696390Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2602.05765"},"observation_digest":"sha256:051106599d6da2618262e1973af6feee80a38da7876adbd22d100236503d9f4a","observation_id":"084fafff-b067-49f9-a8bc-5ba0b9385e35","resolution":{"observed_at":"2026-05-16T07:02:28.930758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2602.06932","last_updated":"2026-05-02T06:02:57Z","snapshot_observed_at":"2026-08-13T08:39:06.155037Z","submitted_at":"2026-02-06T18:28:54Z","title":"When RL Meets Adaptive Speculative Training: A Unified Training-Serving System","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T06:33:41.860803Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2602.06932"},"observation_digest":"sha256:5ecdf394eaedc5d17d48f87b505433f849be320f4421cd8028827dfe647f2d58","observation_id":"996aeed6-6acc-4490-8760-039426f88fec","resolution":{"observed_at":"2026-05-16T06:37:28.921689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T23:32:11.710514Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.13692","last_updated":"2026-06-30T17:19:18Z","snapshot_observed_at":"2026-08-13T15:15:57.031830Z","submitted_at":"2026-02-14T09:26:41Z","title":"ThunderAgent: A Simple, Fast and Program-Aware Agentic Inference System","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T23:32:11.710514Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2602.13692"},"observation_digest":"sha256:691ac76420eeb3cdb4b811674c5d15b74e2926c2e6dd19e2c117790e6022312a","observation_id":"082f7f1c-3122-49c3-9626-0c5d3de20b55","resolution":{"observed_at":"2026-08-02T23:32:11.710514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2603.05295","last_updated":"2026-04-14T08:41:56Z","snapshot_observed_at":"2026-08-15T02:39:12.861336Z","submitted_at":"2026-03-05T15:37:34Z","title":"WebChain: A Large-Scale Human-Annotated Dataset of Real-World Web Interaction Traces","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T16:33:58.746944Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2603.05295"},"observation_digest":"sha256:5e2a6e1a38d9b6525534fa42bc7fa6b528eaf77ae138a0c295a79b9b18aafb00","observation_id":"0167d83b-c497-4164-8fce-0954ae9341c9","resolution":{"observed_at":"2026-05-15T16:36:17.548558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T18:45:20.779259Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06009","last_updated":"2026-07-18T00:55:49Z","snapshot_observed_at":"2026-08-17T08:05:15.894561Z","submitted_at":"2026-03-06T08:07:08Z","title":"Preventing Learning Stagnation in PPO by Scaling to 1 Million Parallel Environments","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T18:45:20.779259Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2603.06009"},"observation_digest":"sha256:2a91c875755e632517209737a5021649c1755838792676acb05af03e71acf724","observation_id":"c0f8730c-77fb-48c0-ac05-e358dc8b2efb","resolution":{"observed_at":"2026-08-02T18:45:20.779259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2603.10165","last_updated":"2026-05-11T10:03:41Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T18:59:01Z","title":"OpenClaw-RL: Train Any Agent Simply by Talking","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T12:56:30.316823Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2603.10165"},"observation_digest":"sha256:971e92f038a032ad0eba2a0eccaeaa9e493fc9936cd41faa3437ad06814e9c22","observation_id":"9e196520-b2b4-49e4-9d2b-1e01e7157541","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.09107","last_updated":"2026-04-10T08:40:56Z","snapshot_observed_at":"2026-08-11T13:05:24.098808Z","submitted_at":"2026-04-10T08:40:56Z","title":"TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:33.020610Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.09107"},"observation_digest":"sha256:e896f72970eb4318c30de9f6e8a195bab6fc66da311b2592ad9c8a4dd1ce1fd5","observation_id":"9799de75-3d03-40f4-8300-dda427b53027","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:79a4d965ee4379467d2e5658f42c83cd89165a2e2c07363c9166de6b09f0f675","observation_id":"a80d0625-6c83-4771-ae17-5c4bf08115af","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.16918","last_updated":"2026-04-18T08:51:29Z","snapshot_observed_at":"2026-08-14T11:02:06.714353Z","submitted_at":"2026-04-18T08:51:29Z","title":"Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T07:27:15.270996Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.16918"},"observation_digest":"sha256:7d5c728cedeec98ff08ba0ef83328e45a4078899705245bf0bf4ca4bdcef0f92","observation_id":"ec567ed1-d217-4fe4-b075-28002f1fae0f","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.18401","last_updated":"2026-08-11T03:19:43Z","snapshot_observed_at":"2026-08-14T23:09:24.260828Z","submitted_at":"2026-04-20T15:22:39Z","title":"CAPO: Critic-Guided Action-Aligned Policy Optimization for Advancing LLM Agent Capabilities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T04:26:59.781416Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.18401"},"observation_digest":"sha256:2c8049508ae495b09669e9304c75989ec0f274204cc761ab897e712214c47bd1","observation_id":"15ec06f5-f9ea-4654-b1b6-b027fb62a2e5","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.23838","last_updated":"2026-04-26T18:45:31Z","snapshot_observed_at":"2026-08-15T03:18:17.487113Z","submitted_at":"2026-04-26T18:45:31Z","title":"JigsawRL: Assembling RL Pipelines for Efficient LLM Post-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T06:36:33.914193Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.23838"},"observation_digest":"sha256:6f830124e296a09fd897f74746bed1e910d41ff2177bc6913c1c4d1ac5867b93","observation_id":"28d5ebe2-0bb1-4463-abb6-4feedf122d17","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.26103","last_updated":"2026-04-30T09:10:31Z","snapshot_observed_at":"2026-08-15T09:19:00.888874Z","submitted_at":"2026-04-28T20:36:50Z","title":"AMMA: A Multi-Chiplet Memory-Centric Architecture for Low-Latency 1M Context Attention Serving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T14:16:46.241126Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.26103"},"observation_digest":"sha256:73ef29cd4cdccaa44087c22eb494c6f05cd1279d8ee965b1054d6f31eb8cf604","observation_id":"3348572b-979b-420c-814a-95fb44087120","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.26256","last_updated":"2026-04-29T03:25:36Z","snapshot_observed_at":"2026-07-06T23:11:57.238808Z","submitted_at":"2026-04-29T03:25:36Z","title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T13:49:26.560459Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.26256"},"observation_digest":"sha256:07710b490488fe4901a58b261226269124b7730c66d9f972016ba276c763d169","observation_id":"8795d9fb-7462-4608-9133-2903e6a01b50","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2604.27083","last_updated":"2026-04-29T18:24:11Z","snapshot_observed_at":"2026-08-16T10:05:17.123494Z","submitted_at":"2026-04-29T18:24:11Z","title":"Co-Evolving Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T08:23:41.819485Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2604.27083"},"observation_digest":"sha256:4b29c33a14af686a96698c02e92861671bcc2f09e4e2bde496d498ae01053692","observation_id":"6de70064-9924-4c14-83f4-7eebe1b6b2aa","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.02178","last_updated":"2026-05-04T03:15:56Z","snapshot_observed_at":"2026-08-12T12:40:32.507029Z","submitted_at":"2026-05-04T03:15:56Z","title":"T$^2$PO: Uncertainty-Guided Exploration Control for Stable Multi-Turn Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T19:36:00.359351Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.02178"},"observation_digest":"sha256:0dd93a8d68aeb00561b921265de151a5a16a338f7711ea236714d79e4965b85d","observation_id":"bb3aa539-f7b4-4b52-b501-bf34ab776043","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-16T07:22:27.044390Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T10:12:58.421050Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:427422139fd5a0acded5566b7a2fd7e434e73a6c9b6ec306596912e37e343f03","observation_id":"0172fdfd-c0ec-48e9-b8f6-0b3c487c0e46","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-16T07:22:27.044390Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:48.838028Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:20da9f0792ec159df17125fe8afcf10299b3bdb122c99c32ec7a47de5a7533ef","observation_id":"60736719-82c0-4c9d-8720-03d335fe16cd","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-15T21:47:26.504858Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:d2f84fdad0a6705c6eef9ac7a14647b1ec5f08f6c489d1d089ee415c2837d4ba","observation_id":"09e56093-512c-44af-9d7f-df841e883179","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.08520","last_updated":"2026-05-08T22:04:48Z","snapshot_observed_at":"2026-08-14T23:41:21.053695Z","submitted_at":"2026-05-08T22:04:48Z","title":"FlashEvolve: Accelerating Agent Self-Evolution with Asynchronous Stage Orchestration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:46:59.400834Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.08520"},"observation_digest":"sha256:e95627d0d67e61dc0172f3a5667fca9fdaba960be3e43af683a4e4b8d99d30af","observation_id":"25b28170-02ac-4885-9097-078af6c18838","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.08862","last_updated":"2026-05-09T10:21:38Z","snapshot_observed_at":"2026-08-14T15:59:33.955936Z","submitted_at":"2026-05-09T10:21:38Z","title":"BubbleSpec: Turning Long-Tail Bubbles into Speculative Rollout Drafts for Synchronous Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:23:13.071107Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.08862"},"observation_digest":"sha256:d4787716cdb0aaa8b6d4a81a74a24024c7f64136fcf382eda78cbd7bbf12400f","observation_id":"8d917e05-0452-4a23-8e23-8177d57a79de","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.09146","last_updated":"2026-05-09T20:10:53Z","snapshot_observed_at":"2026-07-06T23:21:16.454273Z","submitted_at":"2026-05-09T20:10:53Z","title":"Beyond Thinking: Imagining in 360$^\\circ$ for Humanoid Visual Search","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T02:58:46.728868Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.09146"},"observation_digest":"sha256:818d6057e40d407c8b5414a5517d7fd106ef2410fdc8953a00eef745f38bac2c","observation_id":"b8030e71-5ff6-48c6-a20b-9ad790b99e42","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.12966","last_updated":"2026-05-13T04:00:43Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T04:00:43Z","title":"Position: Agentic AI System Is a Foreseeable Pathway to AGI","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-14T20:10:36.101426Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.12966"},"observation_digest":"sha256:0e12763830b19212065ff1cdd7935441cbd84fd502e82a7fa28c91ef73e53c01","observation_id":"a2b86f5d-4b1c-425b-aac8-ef90ab2e10b3","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.13907","last_updated":"2026-05-13T03:36:57Z","snapshot_observed_at":"2026-07-06T23:25:25.361350Z","submitted_at":"2026-05-13T03:36:57Z","title":"AIS: Adaptive Importance Sampling for Quantized RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T03:13:14.384567Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.13907"},"observation_digest":"sha256:a02cc583b5d6c7500f07df7cb38e58829c2037701ae149b721a561793abe5696","observation_id":"61174cbe-8304-48f5-95bc-82e7afc8816d","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.14220","last_updated":"2026-05-14T00:27:35Z","snapshot_observed_at":"2026-08-19T16:50:41.237186Z","submitted_at":"2026-05-14T00:27:35Z","title":"Diagnosing Training Inference Mismatch in LLM Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-15T02:05:44.813341Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.14220"},"observation_digest":"sha256:6c2616d33244de7cc9748644cd20e7a2e06fbd6efe7d94f6f4d4a8f338a0558a","observation_id":"f2ca8497-d292-4e85-b552-d7a97237461b","resolution":{"observed_at":"2026-05-15T14:24:22.137431Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.15224","last_updated":"2026-05-13T08:50:05Z","snapshot_observed_at":"2026-08-08T09:54:59.992034Z","submitted_at":"2026-05-13T08:50:05Z","title":"ICRL: Learning to Internalize Self-Critique with Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-19T17:58:05.817581Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.15224"},"observation_digest":"sha256:1d114e4d1578a6ca810a0af1a24a7987ec4384c9f97e749c643ad26dbbdfbfd9","observation_id":"da7d6f53-7e64-490d-be84-ca520310e3bc","resolution":{"observed_at":"2026-05-19T18:02:42.448329Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:dd90ecd3215e6aa09212e595d1bc490ea7aa404500715a19676ba8866576cd0a","observation_id":"83b5152c-cd27-45c1-90b1-7541046ec6ff","resolution":{"observed_at":"2026-05-20T20:13:43.758614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.18815","last_updated":"2026-05-12T09:51:28Z","snapshot_observed_at":"2026-08-15T22:30:34.771380Z","submitted_at":"2026-05-12T09:51:28Z","title":"DynaTrain: Fast Online Parallelism Switching for Elastic LLM Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T23:07:18.427357Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.18815"},"observation_digest":"sha256:37feaf83ae709b2be76bd17a005a9b2268d7d3a169ba091ec81c3ea0225dcd0b","observation_id":"4f0699d7-5473-4da1-8a3b-44716b2409f2","resolution":{"observed_at":"2026-05-20T23:09:12.222518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-08-15T22:59:46.835288Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T07:32:12.180233Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:0c114e53fc3028c49c3aa8641fdb34502acb759e20901e475e66a0e66e047ef6","observation_id":"fe810c69-4791-45df-a5f5-e6c151d4e47a","resolution":{"observed_at":"2026-05-21T07:34:02.628850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20342","last_updated":"2026-05-21T10:36:34Z","snapshot_observed_at":"2026-08-15T22:59:46.835288Z","submitted_at":"2026-05-19T18:01:26Z","title":"ParaVT: Taming the Tool Prior Paradox for Parallel Tool Use in Agentic Video Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T08:59:28.405218Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20342"},"observation_digest":"sha256:3b94573474a67cad76e2515b57683ca34731097ad61792ac90fa03cd9db53066","observation_id":"15a3adf2-8211-4f33-84b2-6124d127428b","resolution":{"observed_at":"2026-05-22T09:01:19.399223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-16T07:00:27.913861Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-21T07:59:43.755196Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:22da92bbdcc2aab57fca504595830ccbc2a0e28959c5459d7e2cb198496e66fb","observation_id":"dd84ebee-5311-410b-a8cd-666e49a72249","resolution":{"observed_at":"2026-05-21T07:59:50.046588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-16T07:00:27.913861Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-25T05:49:08.484663Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:a2016b542b8fde9aecdf9cfa473b58dff3f2e4700c63bd098b3404d35dc95f17","observation_id":"f6faf070-eb05-4ad1-8e18-b5aed790f443","resolution":{"observed_at":"2026-05-25T05:50:23.726282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2605.20402","last_updated":"2026-06-02T02:26:08Z","snapshot_observed_at":"2026-08-16T07:00:27.913861Z","submitted_at":"2026-05-19T18:59:26Z","title":"Decomposing MXFP4 quantization error for LLM reinforcement learning: reducible bias, recoverable deadzone, and an irreducible floor","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-30T18:01:38.509794Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2605.20402"},"observation_digest":"sha256:ab18100a0eebe9a61d8fbb41d4314e4b2e28c79ffdd9c5efd2151874763fb250","observation_id":"63abdda3-635c-4f93-b652-925b21489d17","resolution":{"observed_at":"2026-06-30T18:04:57.966303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:ad4d11d3b587fcdfd95ba69ab4db135b8a61f8500c071b394db50ae9e42800e0","observation_id":"21bb12d9-3fbd-4aec-a1a0-8f5b899e1174","resolution":{"observed_at":"2026-07-01T20:56:13.542325Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-19T05:16:52.771821Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:17bfff7afb8202f0f81749336c0ef37af1ebe7eea706107ddc51fac08b164828","observation_id":"4c3d9624-528c-4dba-ba31-706b18038b2a","resolution":{"observed_at":"2026-07-01T21:16:13.397428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.04484","last_updated":"2026-07-21T12:35:46Z","snapshot_observed_at":"2026-08-16T03:14:53.050042Z","submitted_at":"2026-06-03T06:02:52Z","title":"AgentJet: A Distributed Swarm Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T06:26:35.100859Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.04484"},"observation_digest":"sha256:a1bb13de9d10be1a2d3514422d91f5d73b89e3935b67f718e5c25624b4146614","observation_id":"912f1d9e-9ba2-49c2-a818-18da27152940","resolution":{"observed_at":"2026-07-02T07:56:47.919524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T12:27:08.279842Z","title":"AReaL: A large-scale asynchronous reinforce- ment learning system for language reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.04484","last_updated":"2026-07-21T12:35:46Z","snapshot_observed_at":"2026-08-16T03:14:53.050042Z","submitted_at":"2026-06-03T06:02:52Z","title":"AgentJet: A Distributed Swarm Training Framework for Agentic Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T12:27:08.279842Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.04484"},"observation_digest":"sha256:030cb1ae2d73b6337a8db72e24581d3ef50d7abae1d4e6d3a196cecf43bbf5cc","observation_id":"00baaa07-cffa-4126-be70-b01ac06ab3a3","resolution":{"observed_at":"2026-08-02T12:27:08.279842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.04560","last_updated":"2026-06-04T06:53:10Z","snapshot_observed_at":"2026-08-13T03:34:48.875235Z","submitted_at":"2026-06-03T07:47:47Z","title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T07:43:21.284574Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.04560"},"observation_digest":"sha256:a19c54171698bc228790e11263a1bd7cc776154608fa9e746bd25b07f97555bc","observation_id":"475c3c1b-5bec-4d66-b206-66aed008a67a","resolution":{"observed_at":"2026-07-02T06:06:41.093107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.09932","last_updated":"2026-06-07T17:58:58Z","snapshot_observed_at":"2026-08-13T23:07:04.214760Z","submitted_at":"2026-06-07T17:58:58Z","title":"When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-06-27T18:49:47.876179Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.09932"},"observation_digest":"sha256:8806a804fc2bd5375917f81bf698c9dfefb8fa7bda3992eb1c5c53ba8d2603bf","observation_id":"43f1bb11-1658-4ba3-8889-5204cecca945","resolution":{"observed_at":"2026-07-02T22:27:26.415608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-12T13:36:16.324487Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:519284d69d420b5e89a793f8ad21fe296cac8032fad6aba04c44c334cbaefee2","observation_id":"bf90f729-bc4c-4830-bad0-4c32d4ac6787","resolution":{"observed_at":"2026-07-03T09:47:59.826024Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.11867","last_updated":"2026-06-10T09:42:11Z","snapshot_observed_at":"2026-08-14T16:02:38.952970Z","submitted_at":"2026-06-10T09:42:11Z","title":"Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T08:35:16.435272Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.11867"},"observation_digest":"sha256:0e85e9ab6af9cafd7712452e1abd84517f04f75b8f0c409eaf4464814d8c6fe6","observation_id":"e5c4347e-bbdf-42ec-b2c4-c64d284cef51","resolution":{"observed_at":"2026-07-03T13:08:07.825297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.15079","last_updated":"2026-06-13T03:21:49Z","snapshot_observed_at":"2026-08-14T19:26:18.721015Z","submitted_at":"2026-06-13T03:21:49Z","title":"Ling and Ring 2.6 Technical Report: Efficient and Instant Agentic Intelligence at Trillion-Parameter Scale","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-02T22:10:59.568675Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.15079"},"observation_digest":"sha256:eda963fdbc19f9305c4e46c569105f1d44cd2817df97b04c55d7a75607c19141","observation_id":"aa490fe4-6ae8-453c-b334-d1b6aa5aa84f","resolution":{"observed_at":"2026-07-02T22:17:25.513987Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.19004","last_updated":"2026-06-17T12:31:44Z","snapshot_observed_at":"2026-08-13T14:58:28.448658Z","submitted_at":"2026-06-17T12:31:44Z","title":"Spotlight: Synergizing Seed Exploration and Spot GPUs for DiT RL Post-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T19:06:16.100762Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.19004"},"observation_digest":"sha256:ab92f0456d0a79f55bafb428257b162482f5375fd702b67f6bcea9a4a016e7eb","observation_id":"2dbde3c1-555d-477d-a89b-deda0b49132d","resolution":{"observed_at":"2026-07-04T02:49:24.703409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.26997","last_updated":"2026-07-05T07:05:22Z","snapshot_observed_at":"2026-08-13T05:19:40.001059Z","submitted_at":"2026-06-25T13:14:14Z","title":"RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T02:56:47.102678Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.26997"},"observation_digest":"sha256:6c71441d9a56dec2cfed24a6ec28ff3dbb164f5010ad879c752281add176fd34","observation_id":"7b89e743-e38f-407b-b510-32c2ae4d4f9c","resolution":{"observed_at":"2026-07-04T14:39:58.209992Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-07-12T11:52:35.159984Z","title":"arXiv preprint arXiv:2505.24298 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26997","last_updated":"2026-07-05T07:05:22Z","snapshot_observed_at":"2026-08-13T05:19:40.001059Z","submitted_at":"2026-06-25T13:14:14Z","title":"RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T11:52:35.159984Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.26997"},"observation_digest":"sha256:0491c236ef70724d26d0f75761ce06b291db67bdc66c26b55111133447a48306","observation_id":"5149cbf7-dd78-4fc9-8aef-3cc9b5dbac56","resolution":{"observed_at":"2026-07-12T11:52:35.159984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2606.27580","last_updated":"2026-06-25T22:12:22Z","snapshot_observed_at":"2026-08-12T16:03:51.304093Z","submitted_at":"2026-06-25T22:12:22Z","title":"Retroactive Advantage Correction: Closed-Form V-Trace Bias Correction for Delay-Aware RLHF","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T01:23:07.441218Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2606.27580"},"observation_digest":"sha256:01840d66b3e1e7de8595d0b9d5f365da652a1593bf6b664d369f7960dfe6c8cd","observation_id":"c1d0c60b-fe75-4399-b3b0-a1d287f2b334","resolution":{"observed_at":"2026-06-29T05:43:07.654879Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2607.06763","last_updated":"2026-07-12T19:52:09Z","snapshot_observed_at":"2026-08-19T00:50:02.737868Z","submitted_at":"2026-07-07T19:48:36Z","title":"Trees from Marginals: Autoregressive drafting with factorized priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T21:49:34.512370Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.06763"},"observation_digest":"sha256:e384f9469606e70add875460c76366275fd39edf1f43e0919c256f6f2019f794","observation_id":"32bec269-cf7f-47ad-a24a-e0b2e9c40ea8","resolution":{"observed_at":"2026-07-10T21:57:39.209960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-07-14T15:58:05.356765Z","title":"AReaL: A Large­Scale Asynchronous Reinforcement Learn­ ing System for Language Reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06763","last_updated":"2026-07-12T19:52:09Z","snapshot_observed_at":"2026-08-19T00:50:02.737868Z","submitted_at":"2026-07-07T19:48:36Z","title":"Trees from Marginals: Autoregressive drafting with factorized priors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T15:58:05.356765Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.06763"},"observation_digest":"sha256:595623cdbcbfa214bfd68dc97c5b5b3c33384eaf0574b1846a106f11b430ddff","observation_id":"d5e0de3a-0c46-403c-b27a-60b45309e067","resolution":{"observed_at":"2026-07-14T15:58:05.356765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":"2505.24298","doi":"10.48550/arxiv.2505.24298","metadata_source":"pith","pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","venue":"cs.LG","work_id":"60017c83-cbbd-4807-b8e4-f8149a6aeaf0","year":2025},"citing_paper":{"arxiv_id":"2607.07508","last_updated":"2026-07-08T15:02:19Z","snapshot_observed_at":"2026-08-13T17:31:55.182872Z","submitted_at":"2026-07-08T15:02:19Z","title":"Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T08:51:10.098370Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.07508"},"observation_digest":"sha256:e3d54bb861e1c3afef555406e19a0b07c814bd951bb20fcac58c724cb1dc2b37","observation_id":"92f02aa6-2291-45cd-95a5-382a9e360cfa","resolution":{"observed_at":"2026-07-09T08:56:06.428422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-07-13T04:42:35.589143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09207","last_updated":"2026-08-05T13:11:42Z","snapshot_observed_at":"2026-08-16T05:25:44.312422Z","submitted_at":"2026-07-10T08:51:14Z","title":"Bidirectional Resource Scheduling for Disaggregated and Asynchronous RL Post-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T04:42:35.589143Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.09207"},"observation_digest":"sha256:0983dacebc64d93267889c82b60c03bcf0be70a9e2d149b1fb4457f9c74825bd","observation_id":"55ea7ddb-1643-47ed-84ce-597ab67dd347","resolution":{"observed_at":"2026-07-13T04:42:35.589143Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T06:37:37.177652Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-15T14:50:02.087485Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:37.177652Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:cbd2f9114839e76c8b3603d13100adf000ce3d4c83e73e04e24c27cb51fc41b4","observation_id":"f0bd608c-2077-4856-a6e6-5c3f70d9e353","resolution":{"observed_at":"2026-08-02T06:37:37.177652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-01T18:29:31.579850Z","title":"arXiv:2505.24298","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17299","last_updated":"2026-07-19T15:31:13Z","snapshot_observed_at":"2026-08-15T19:13:30.871033Z","submitted_at":"2026-07-19T15:31:13Z","title":"WAR: Workload-Aware Rollouts for Synchronous Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:29:31.579850Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.17299"},"observation_digest":"sha256:20eaa5af21a1ea3dbf27c64b816d9cded03e9b206af714ddd7542f3d730ca00a","observation_id":"14b69ad0-a0c3-473e-83bb-8a8b6deaf7cf","resolution":{"observed_at":"2026-08-01T18:29:31.579850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-01T09:49:28.853734Z","title":"AReaL : A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21653","last_updated":"2026-07-22T18:06:15Z","snapshot_observed_at":"2026-08-16T00:01:48.670141Z","submitted_at":"2026-07-22T18:06:15Z","title":"Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T09:49:28.853734Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.21653"},"observation_digest":"sha256:9d6611a3170e23363521d110918b2f0f6e7e885714bd5f94a005bd6c9b2c3f5f","observation_id":"7f2db113-7f86-4a24-8845-7519a8acf1ce","resolution":{"observed_at":"2026-08-01T09:49:28.853734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-01T06:48:17.311342Z","title":"arXiv preprint arXiv:2505.24298 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-14T22:32:30.695699Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.311342Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:e3c167fd3dfed5a39d865cdb5c24bd477f1889626672ff53ea78ee3771bc4258","observation_id":"4cd5dede-04e4-47e8-a00a-115009c85765","resolution":{"observed_at":"2026-08-01T06:48:17.311342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-02T11:13:59.560465Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22614","last_updated":"2026-06-15T09:41:09Z","snapshot_observed_at":"2026-08-15T11:42:07.610925Z","submitted_at":"2026-06-15T09:41:09Z","title":"DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T11:13:59.560465Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2607.22614"},"observation_digest":"sha256:018a9c9107c6ab3501cb3851c19e2c01020547b6c9bbc90173a64f77607ef70c","observation_id":"4a1c46ae-723a-478a-990e-bf9e9890cca4","resolution":{"observed_at":"2026-08-02T11:13:59.560465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-16T00:21:54.676497Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12146","last_updated":"2026-08-12T15:07:15Z","snapshot_observed_at":"2026-08-19T23:59:35.540931Z","submitted_at":"2026-08-12T15:07:15Z","title":"RoutePack: Expert Placement and Attention-Aware Data Packing for MoE Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:21:54.676497Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2608.12146"},"observation_digest":"sha256:5ae24b98c84922a106887e0cfd0f449d76ef81acc9f0e306118c357866715549","observation_id":"71f91b49-f0e4-484c-a3be-bae211de684a","resolution":{"observed_at":"2026-08-16T00:21:54.676497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24298/citation-record","integrity":"/paper/2505.24298/integrity","json":"/paper/2505.24298/citation-record.json","paper":"/paper/2505.24298"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1912.06680","doi":"10.5281/zenodo.17096679","metadata_source":"pith","pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","venue":"cs.LG","work_id":"b047dc18-e9a3-4d11-8ff6-cd59d41a6357","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:4216dcf516f2bfcb5ef93f542fedc668c2b68223a81e012f2a4c7b04b4ccab65","observation_id":"f1b5f65d-5401-46eb-a59d-e09f50458e72","resolution":{"observed_at":"2026-05-15T14:24:22.034522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:8151a13481e8b752c332b21a6eadb0f35123ec4d14962279c3c93d8244935a35","observation_id":"04c98360-1a8c-4d4b-9851-275de73d2520","resolution":{"observed_at":"2026-05-15T14:24:22.024153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e8f2590-79af-491f-9142-599ba03cbebb","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:ef5e2ee660435dbad2cfcdcc71aaee4b06fe4a8e39fcbc0d7eb2c9a1af1d764e","observation_id":"c68c561a-5cbb-46c8-b5b1-78b1f6320f9f","resolution":{"observed_at":"2026-05-15T14:24:22.092893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:d1ad16872f8a29b46872b9e11547b2cf0d2cbfaf6dac4880a1dbaccb9e5ed181","observation_id":"f6726aac-2bc3-4aa1-867d-592e16976e21","resolution":{"observed_at":"2026-05-15T14:24:22.061360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Espeholt, H","venue":null,"work_id":"c8686f95-7ff2-4fbf-b5bc-f1243774d697","year":2018},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:aa95596018af90d7ca2cea4cb28bf924afe55690f8f2ac4f601f0ddcfcf711f9","observation_id":"907e8104-ed56-4057-aa42-6ef156b66393","resolution":{"observed_at":"2026-05-15T14:24:22.095148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Espeholt, R","venue":null,"work_id":"7453fc37-48f9-4807-a533-db4aeaa8651f","year":2020},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:2801c0aee08eca33b94b14a87a65a13de7fe2d62155b272c318914c7f18e8d2d","observation_id":"09668f0b-c48b-454b-8315-75fc0a8cb846","resolution":{"observed_at":"2026-05-15T14:24:22.097530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hendrycks, C","venue":null,"work_id":"b4e42848-67f4-4d87-a89e-735f781d4cb9","year":2021},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:fc73e186d1f14b7a4ef8a20174653f862d94cde6eade6d493195158f205c1a4f","observation_id":"65c5e111-101c-433e-b470-277b310c206f","resolution":{"observed_at":"2026-05-15T14:24:22.099511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hilton, K","venue":null,"work_id":"078df402-9f98-4cdb-88cc-9878000addce","year":2022},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:c945cd881afd5c689a1ced0407454f662407eb535205e0ebb09ceadf4f7d23ba","observation_id":"50b91d8b-0a5f-45b3-913e-904d135b37b4","resolution":{"observed_at":"2026-05-15T14:24:22.102020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:8b2dd349810c980addf736fed6946bf8b2c1dff8302e080e8a4d1bb64c9283b4","observation_id":"ddd1dcba-6b8a-4ca0-9e75-122efaeeb268","resolution":{"observed_at":"2026-05-15T14:24:22.069097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a5940e90-4e82-4787-8e0e-396ac731a615","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:79006550fa25c2c9fb49751d3af714c1c44e297875e115b6ee1904f6fae40f7b","observation_id":"1a8ba6c0-7b7e-4f1c-a6ae-8e5caf4218e9","resolution":{"observed_at":"2026-05-15T14:24:22.104566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c8dacdad-37cb-47b2-b218-2570efd547b8","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:8086240bd8ace3db0b58e8df0509977a888f96e0ab9aa0c0c771566488202b9c","observation_id":"d379ce49-8768-4e9f-824c-cb32e3bfe0d9","resolution":{"observed_at":"2026-05-15T14:24:22.107087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2a2e6dba-1da5-4d3b-8273-66226f4eeba2","year":null},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:83101d9ebe7da4c416cf5dae1ae1651ee645aa31717783894b7062a7f8e4a90a","observation_id":"842f1a27-327f-4e04-9398-54f70b48c754","resolution":{"observed_at":"2026-05-15T14:24:22.109287Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kapturowski, G","venue":null,"work_id":"cbf25ee5-7b45-48e4-a20f-c466d0989e61","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:20e79bb98e238c8eef1a568fae66efd50887bd45f1c5f9a9fee29937814459ef","observation_id":"006a0879-9795-4d9f-a0a4-1c4ed76a61c7","resolution":{"observed_at":"2026-05-15T14:24:22.111431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0006.361316","doi":"10.1145/3600006.3613163","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention , booktitle =","venue":null,"work_id":"1b10f2a9-a178-4d23-97fb-8db2354c7e6c","year":2023},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:b4f1a6784c3537d00939f5384c71e264e87f6a2570207a028e288369c1596cd3","observation_id":"2bcfd707-7ecc-45ae-9639-e65d83ae8a57","resolution":{"observed_at":"2026-05-15T14:24:21.973774Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0190423a-3896-4246-99aa-29b7642ebff8","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:9789fba9202cc90f11be81b97c1d207ef545671bd5184184c537043bd85577b4","observation_id":"3afe3235-b742-4fdf-9ba2-163c2ef1226f","resolution":{"observed_at":"2026-05-15T14:24:22.113383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3f7ae36d-dbb2-4cf4-a491-167ba7ba1f57","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:6a00525d7594b705e97822a8c2bc28ed3bd5530ace5f662b17b7596790273cab","observation_id":"a83167a8-ffea-4f7c-80bb-72c2b906a51b","resolution":{"observed_at":"2026-05-15T14:24:22.115514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Liang, R","venue":null,"work_id":"3b7c5953-7942-4b88-915a-fd426ef22207","year":2018},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:390132649c8d6a7941b319e5015ce645b5b0a969022699abb35d1c90e46ca5ff","observation_id":"cd3d6ccb-9aac-4db8-8979-46e7f573bb14","resolution":{"observed_at":"2026-05-15T14:24:22.118256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-18T19:02:23.250634Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":"2502.01100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-07-04T18:30:01.604649Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning","venue":null,"work_id":"a87849c2-9339-401d-8ff9-7776817fe025","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:36b519f72c965cda5e073e36f596003aa32e1d48e17f88217dcafcd090cc6a56","observation_id":"00c3bd1a-c9f2-4983-9911-f4b4947d08cd","resolution":{"observed_at":"2026-05-15T14:24:22.051843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f794bc97-adb0-44cc-bf84-50a80b8f9824","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:25e0887863bf6e4bf2fcf66cabf1836f387fb00f78394a9be52ccaa7e3bc49e5","observation_id":"4c66119e-5d22-4e30-b656-2bc41e0ceaef","resolution":{"observed_at":"2026-05-15T14:24:22.120199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2c776b3d-5e98-4592-af0a-1530f75b6863","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:e5460e4c2d1939c23138d4a61d43a8a01cbb28186d1f5ccb3d6113b06708a26e","observation_id":"5b2a3e38-cc70-4796-8b56-a8489d7d4d67","resolution":{"observed_at":"2026-05-15T14:24:22.122299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"df5f3a8f-b097-4946-8af2-ba69203e8ac8","year":null},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:1c3799a77b3a06f3b1dc2c1562f0cf2688d7a61cb999e2a3025643b792c84909","observation_id":"bc842cf3-3971-4022-b753-e1754b602810","resolution":{"observed_at":"2026-05-15T14:24:22.124185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fdd14da8-deb7-4b10-9142-1b8feee0c2e9","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:cf99c32b5a97ae8525100fdeabbb5b8cd30fd3d107d40d0b3f8a40ce0614be9b","observation_id":"5187a572-3c6a-49dc-b575-ee6e3fe22140","resolution":{"observed_at":"2026-05-15T14:24:22.126219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0666.365133","doi":"10.1145/3620666.3651335","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Specinfer: Accelerating large language model serving with tree-based speculative inference and verification","venue":null,"work_id":"787d8561-54f3-48ff-bca1-03582f84d470","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:803fdd3b6d0e22f846661b13853349222fb3771314e04c136dc8cd1a2bd545be","observation_id":"2fe33030-686b-40dd-a9d0-a8732103d5fa","resolution":{"observed_at":"2026-05-15T14:24:22.009165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:50:18.8352+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:50:18.8352+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URL https://openai.com/index/ learning-to-reason-with-llms/","venue":null,"work_id":"6a7a5b8d-4234-429c-a441-b8d8349f3b8a","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:462e344e3d5a321491a71945a0255f434f73a35a2a5ebd51cfdb9d6f0ff2aeb9","observation_id":"9ac1dd7b-70c8-4f58-a4b3-041e34200782","resolution":{"observed_at":"2026-05-15T14:24:22.128959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URL https://openai.com/index/ introducing-o3-and-o4-mini/","venue":null,"work_id":"80a7f80c-d25a-461f-8f0b-fd702d0f0015","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:c1073e68f0739dd7106123195ea107f6832b85c537ec4b6cf49504f26f7ce315","observation_id":"22c0fc43-2c26-490e-8a5c-a489cb6e1b09","resolution":{"observed_at":"2026-05-15T14:24:22.131543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ouyang, J","venue":null,"work_id":"03573fc9-6bfb-4bd7-b8a8-5d56fc51eff9","year":2022},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:103c05c275b0f83a939a4af80e0c41ba7d1b09702389e433146474b322ef69ec","observation_id":"17be9c91-965d-422f-85f3-be94cfbb6859","resolution":{"observed_at":"2026-05-15T14:24:22.134269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9bcf8fe-c02d-4ae0-b342-9a4a3b0ccbe5","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:c38a32ee295fe9a8c651d12946957db86bc0c242190dbf5a96867dad63d90d1a","observation_id":"746cce49-6e19-44ed-a3ce-a0c2003f75ea","resolution":{"observed_at":"2026-05-15T14:24:22.136472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paszke, S","venue":null,"work_id":"2f2338d8-55f7-4a2d-93be-3992f51d9137","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:256fd4fe631a3382a1540fdb722376c6f56b76bad424d08a54f31b358b2aa431","observation_id":"ec081b8d-129c-43c1-8ab9-c91d41defadf","resolution":{"observed_at":"2026-05-15T14:24:22.071955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/9780470316887","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.010744Z","title":"Wiley Series in Probability and Statistics, Wiley (1994)","venue":"Wiley Series in Probability and Statistics","work_id":"02ff1fe9-a285-487d-a56f-1e5ddd479dd7","year":1994},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:ebb1dcde83a6c40c3196a6a8331bb33377bad2eb490887be0e9f936f034fa580","observation_id":"b34c7e4e-1a27-448a-892a-0bbd00897967","resolution":{"observed_at":"2026-05-15T14:24:22.012386Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-13T22:38:06.683582+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T22:38:06.683582+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.2020","last_updated":"2014-05-08T17:04:15Z","snapshot_observed_at":"2026-08-14T23:34:44.373057Z","submitted_at":"2014-05-08T17:04:15Z","title":"Generalized Slow Roll for Tensors","version":1},"cited_work":{"arxiv_id":"1405.2020","doi":"10.1109/sc41405.2020","metadata_source":"pith","pith_arxiv_id":"1405.2020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalized Slow Roll for Tensors","venue":"astro-ph.CO","work_id":"32348cef-09e4-43f2-b53c-d785fa1937a5","year":2014},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/1405.2020","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:3d27c1c67f261ad46db39c73d2f7688100d90a85c529648f3db76e9db1640402","observation_id":"4cfce521-ebf0-4a16-bfe9-efb03efa7f1c","resolution":{"observed_at":"2026-05-15T14:24:22.016165Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.178338+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.178338+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schulman, P","venue":null,"work_id":"f7ef5471-c505-40cb-99b4-ad7a3b6cc039","year":2016},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:0b546df09d74275e7071774bc6a08eb6e272dbd53d3dbea2c6fbd4c7a02babff","observation_id":"75a53cec-ed67-4faf-a111-953e497e4cbf","resolution":{"observed_at":"2026-05-15T14:24:22.074665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:736d03913df343f03b6408e769b65f371b310190d843acec2afc2e65a631fac2","observation_id":"1df6b9ad-1039-4be0-b252-ddcca0f8182d","resolution":{"observed_at":"2026-05-15T14:24:22.038379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:6d1e0da1e006c3d3c81dfc8b002daf61365f2426fe52dc8b50ba592fe526b670","observation_id":"80570ad7-d6ed-406a-8833-791c6d4c419a","resolution":{"observed_at":"2026-05-15T14:24:22.042354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9031.369607","doi":"10.1145/3689031.3696072","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"4909736c-3fe1-4820-b489-cca51669c6d2","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:20ba526a5bb4c99a415a1cf426258a7c9d18e8f9b6a1161277f240e1871be2b3","observation_id":"55dbd829-c259-4871-b28d-53e033abd762","resolution":{"observed_at":"2026-05-15T14:24:22.003970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:18e0e9ef43473a7a82dd7a2ab3fb8a6505b6636b180ad05bdfb197bcde3ed39f","observation_id":"9b490396-40b7-48ba-8703-c5eb8ac69ba5","resolution":{"observed_at":"2026-05-15T14:24:22.046981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6d6669d5-aaef-4d58-b8e0-f5b8ab9f2e1e","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:a12f3a4895e8307f4937ce4e94666d1376c8101ddff7793b01a00e7532712b18","observation_id":"bf02d8bd-d30e-42e4-80c0-b9cd86e0f88e","resolution":{"observed_at":"2026-05-15T14:24:22.077208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07291","last_updated":"2025-05-12T07:24:33Z","snapshot_observed_at":"2026-08-17T05:33:55.034780Z","submitted_at":"2025-05-12T07:24:33Z","title":"INTELLECT-2: A Reasoning Model Trained Through Globally Decentralized Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.07291","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07291","snapshot_observed_at":"2026-07-01T20:56:13.377646Z","title":"M., Straube, J., Basra, M., Pazdera, A., Thaman, K., Ferrante, M","venue":null,"work_id":"9233b23c-abcc-4449-8d29-93e7185d2028","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2505.07291","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:0681d6c50b951401f3d90b9284d0ecba4156e18fe07153d0281ef89057bc3159","observation_id":"a9bb1a91-530b-4c64-91dc-330177927b5a","resolution":{"observed_at":"2026-05-15T14:24:22.057134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"f26d8809-245a-4947-968f-d008bdce98ed","year":2017},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:7f50dd832e0a99fc55947992ad5cd4caee5c1e543c791e959c9b22f8ff775d76","observation_id":"ac46e50e-a781-4a67-b569-1d9158477b2e","resolution":{"observed_at":"2026-05-15T14:24:22.079530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-019-1724-z","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liar” ends the game, then both players reveal their dice. If the last bid is not satisﬁed, then the player who called “Liar","venue":"Nature","work_id":"c3ffdbb1-14d6-4ff7-9e3b-b49b08128fc9","year":2019},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:995a299b5c4fee93fb62ff9884dab9ef1e0a47de6ac626d91bc6dd9e677a3c06","observation_id":"bb8f25bb-19ec-4261-b3a5-29ee5836815c","resolution":{"observed_at":"2026-05-15T14:24:21.993334Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-20T12:22:21.671676+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T12:22:21.671676+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aed0f520-348e-428b-b99e-b92a4733bddf","year":2022},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:104848f08fd123b4ba141e6b1923a9a1ffdd6bba513f74e8480992f70fb4799e","observation_id":"776aaf06-5ed0-4e76-b9fe-01a51c09984b","resolution":{"observed_at":"2026-05-15T14:24:22.081758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-08-16T13:50:18.721796Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":"2405.14333","doi":"10.48550/arxiv.2405.14333","metadata_source":"pith","pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data.https: //arxiv.org/abs/2405.14333","venue":"cs.AI","work_id":"dbc70c01-dc01-42b7-8edc-25b7f061d5d6","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:1d08df12c042cf37748abc76c638ec1aa87a15356785e4aae8eb447b983598be","observation_id":"b991c518-178b-426d-a6ca-76576e505494","resolution":{"observed_at":"2026-05-15T14:24:22.065868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.905938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.905938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"55d17d16-5fba-48a3-8f2c-9c3557fa0be5","year":2003},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:41c7f8b4e89aa6f33cb92934d96d05444e320e0e50650ac874bb420881baee04","observation_id":"3628c109-2250-48f9-95a8-63f07031ee6a","resolution":{"observed_at":"2026-05-15T14:24:22.083916Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/10968987","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Job Scheduling Strategies for Parallel Processing pp 44–60","venue":null,"work_id":"eb6ecc72-65fd-470f-a23c-0c93fa1f7725","year":2003},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:2cc0d13edd04c40579ae25f119a3758ca89b11e40e11b2cf4799b46bfa8ab661","observation_id":"ed6d1c0e-4631-41c4-aa10-076c7defaa9f","resolution":{"observed_at":"2026-05-15T14:24:21.978165Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:088c7f5360b5a4f11315509607b78d2aaa165654293a7950adbdb0138ffeb0ce","observation_id":"79e61d0b-a2c8-4729-9c60-20162a21aa35","resolution":{"observed_at":"2026-05-15T14:24:21.986322Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:e9e22642f9ff8e0d0de8b0dcb766c146abc33692cd1c94b140fc85b119dc178d","observation_id":"4fd6d89d-55ff-46da-b1b7-fae958d9c605","resolution":{"observed_at":"2026-05-15T14:24:22.020162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1540.361156","doi":"10.14778/3611540.3611569","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"I am EdgeRunner AI","venue":"Proceedings of the VLDB Endowment","work_id":"2fecc4e1-0d3a-4003-bd43-23d1f5da5be2","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:e35afc795a496f006c5888bd905c88fa9da5fd51e5517592dc6a9b28fe91ebcd","observation_id":"e28f579a-43c0-4b89-bbaf-fd5e5bc8e433","resolution":{"observed_at":"2026-05-15T14:24:21.999394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-19T23:52:03.068603+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T23:52:03.068603+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zheng, L","venue":null,"work_id":"77a8cf65-4325-43a1-b4ec-774810767e64","year":2024},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:a6e219ebecec639a019f0ccceb5c518436a795ea4faef36303988b72088bdbd2","observation_id":"52324d64-6c04-4d1f-801f-61360ca221ce","resolution":{"observed_at":"2026-05-15T14:24:22.086140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-08-20T01:49:19.844891Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":"2504.15930","doi":"10.48550/arxiv.2504.15930","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streamrl: Scalable, heterogeneous, and elastic rl for llms with disaggregated stream generation","venue":"ArXiv.org","work_id":"63df3644-702d-4ae6-8e4a-954a41887545","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:1c135674df6a711371459effabd1a44466e13e4e13d7cb02838f226458a01f34","observation_id":"59953177-8abe-4da9-bdfe-30c73e0f5279","resolution":{"observed_at":"2026-05-15T14:24:22.029099Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T08:50:16.320291+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"15c1c53c-e7c4-4531-8823-3d7058d411c3","year":2025},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:b1d6b7ab0f2d033966d2f1b6455a5cf0feeccd4fbe02a76a95271746ac06d13d","observation_id":"ef40b99f-46ba-4556-bd29-cd07bb5f073d","resolution":{"observed_at":"2026-05-15T14:24:22.088384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For most of the results, we use SGLang [63] v0.4.6 as generation backend and pytorch FSDP [ 62] as training backend","venue":null,"work_id":"2d6c7d88-04c8-4d4f-85f1-673edeed1f57","year":1911},"citing_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:21.930934Z"},"links":{"citing_paper":"/paper/2505.24298"},"observation_digest":"sha256:d3003175c55c3de78d75869d4f8a771849c4260a9fc2b6f8376536ccfdcde6a7","observation_id":"d73722ed-f188-4954-af71-82d1754581e9","resolution":{"observed_at":"2026-05-15T14:24:22.090551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","latest_version":5,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":2,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":14,"verified_exact":15,"verified_fuzzy":15},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 82 inbound Pith citation observations for arXiv:2505.24298."}