Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T16:08:42.904325Z
Paper Citation Record · LEDGER
As of 19 August 2026, this Paper Citation Record lists 100 of 101 outbound references and 27 inbound Pith citation observations for arXiv:2509.08755.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-15T16:08:42.904325Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-15T15:49:16.072327Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z
100 of 101 outbound references displayed
External citation measurements
0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z
Observation c05bde1c-daba-41ab-858c-d56e8af08986 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4 Technical Report
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 49032693-a826-4a29-9457-6506e9a5e2b7 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 1(1):4, 2024
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f7dbd590-1d6a-413f-99a3-77c5ad84036a · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gonzalez, and Ion Stoica
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f45c9255-87da-4228-b342-8b599bef5c8f · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning FireAct: Toward Language Agent Fine-tuning
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ed751628-26f4-40fc-9c7c-eb9e32f6c7c4 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Improving discriminative capability of reward models in RLHF using contrastive learning
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 86434bf1-b516-4191-8f16-b879b95b0f87 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Agent-flan: Designing data and methods of effective agent tuning for large language models
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ed35ed01-0716-4185-a42a-23a285b0ef14 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Babyai: A platform to study the sample efficiency of grounded language learning
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e79c8b03-2825-4e4e-9cf0-33bd564a9038 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dc9bb8dd-b2ff-4467-85c6-aa5607682a42 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Inference-aware fine-tuning for best-of-n sampling in large language models
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f2ecc788-fdaf-421e-9f15-07790ea41ba4 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a8372011-820b-4c2e-be2d-9f100e52ecb5 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeek-V3 Technical Report
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1b8af236-0990-4b07-a26f-057d2e69a667 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5e6eaf16-555d-4dd0-a9fb-d6ffb8d728e6 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Mind2web: Towards a generalist agent for the web
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e8fdb23b-6492-4fe3-94fa-30db71a195c5 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The Llama 3 Herd of Models
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d7627416-45e8-4088-88d1-72b8d982b0bc · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Minedojo: Building open-ended embodied agents with internet-scale knowledge
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b213f8a0-2881-4799-be1d-a01b14a50df5 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning MASTER: A multi-agent system with LLM specialized MCTS
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 530ccc16-1a6b-4563-9874-f3d5ff548979 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning CritiQ: Mining Data Quality Criteria from Human Preferences
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2205a3cc-2d4d-4173-85bb-e2314cd0add3 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Skywork Open Reasoner 1 Technical Report
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c344a969-57c9-451e-a85f-76a326e8ccab · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Constructing A multi-hop QA dataset for comprehensive evaluation of reasoning steps
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e50dbf88-be7a-4933-ab4e-144c6aba55e3 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Metagpt: Meta programming for A multi-agent collaborative framework
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e6223821-3664-4649-a17a-33fb68b3761a · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 111f82ab-f716-4c46-b9bf-fb68df4df0b2 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4o System Card
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 376527cd-9e01-411c-9ef1-b4174222c4a5 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning OpenAI o1 System Card
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 53c100a1-18f2-4289-8aa7-e1bdba625018 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AI Alignment: A Comprehensive Survey
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6252f0a3-8341-473e-9c5e-a6ab0203c525 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 42ea67a9-d00d-477f-af5c-5db7e70c5703 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a25a3e2-e9f6-4264-8b77-1bdda9d6d28e · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5929d08b-6932-4434-acfe-716666a3bbc7 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Weld, and Luke Zettlemoyer
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4fab054a-dddf-448e-9ad1-9677d8bcab3d · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Buy 4 REINFORCE samples, get a baseline for free! InDeep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, New Orleans, Louisiana, United States, May 6, 2019
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dd9332c2-98fa-4616-a708-bab05710d2cf · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a0738f59-79e2-4968-9655-480a767e8fcd · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning More agents is all you need.Trans
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f7809971-b5cd-467e-aea9-edc65795bce4 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Encouraging divergent thinking in large language models through multi-agent debate
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b7f86344-60f1-4f52-bd54-944b461c78a0 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Liu, and Jialu Liu
Reference 35
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 55ebdc1b-1191-4e32-8427-e3c785c9369f · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning BOLAA: Benchmarking and Orchestrating LLM-augmented Autonomous Agents
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d92eb505-e877-47e4-987e-cd492bb7f1c5 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 15731945-d2eb-4750-b3c3-2ceb611e86b6 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b7138712-6bd5-4117-b8c0-f178d9bf9133 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Kimi k2: Open agentic intelligence
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ce435bc5-a146-41d3-a9c4-f770f8031dc7 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Long-horizon planning for multi-agent robots in partially observable environments
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 36bf6acb-606e-47f3-9aac-e4e9d6176570 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4 Technical Report
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 47240b98-5128-4d14-b8e2-2f03074258c1 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Openai o3 and o4-mini system card.https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758 f3722c1/o3-and-o4-mini-system-card.pdf , 2025
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5e3fe7b8-b4da-4fb0-a8df-baded709a4a4 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 321eaa35-7b2d-474d-8950-07ffb70bdcdf · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Instruction Tuning with GPT-4
Reference 44
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9b764c18-7e86-434b-a960-41adf7aa6d7d · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Adapt: As-needed decomposition and planning with language models
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 66b95654-95a8-4cf7-94a1-3ca5e94da924 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Smith, and Mike Lewis
Reference 46
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4001e3d7-f7fa-4c3d-949a-d1c204ddf3f7 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Webrl: Training LLM web agents via self-evolving online curriculum reinforcement learning
Reference 47
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c5ef7cff-6d59-4efa-a6bf-4c3b4a9d8348 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work
Reference 48
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0b3685b8-ed08-4a38-87d0-4e7e501a990d · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwq-32b: Embracing the power of reinforcement learning, March 2025
Reference 49
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 9291ba2a-da47-456c-a360-ff861717daa1 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Manning, Stefano Ermon, and Chelsea Finn
Reference 50
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation cc80a67f-3fc9-4482-8598-a56495206e19 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Self-Reflection in LLM Agents: Effects on Problem-Solving Performance
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9a93ac67-fd24-4d93-a7c1-13618bbab08e · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Jordan, and Philipp Moritz
Reference 52
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 3628a375-f5b5-4de0-9c05-72ff6564ba58 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Proximal Policy Optimization Algorithms
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation adb5e41d-7329-459e-b544-53531c9a35ac · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Reference 54
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 81c7e9db-2afa-4e3c-b41f-20ce6ca35031 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
Reference 55
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1b9fe2dc-42ba-49ab-b6bd-55913403c21e · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Hybridflow: A flexible and efficient RLHF framework
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c11cf04b-2b0a-468a-8847-9ae872096c58 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Reflexion: language agents with verbal reinforcement learning
Reference 57
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation fdf115c4-19aa-4508-93da-604656978bf9 · outbound
Reference 58
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 31498db6-3b98-4ac0-8bc3-6f23664490a5 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work
Reference 59
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 8f7a4cf1-50f9-4d7f-a561-8f4e715ce3b0 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning PaperBench: Evaluating AI's Ability to Replicate AI Research
Reference 60
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 006026b6-3723-4002-9bce-af7a72e9acd1 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
Reference 61
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 03106ecc-edab-42a8-a294-27719c248ed9 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Sutton and Andrew G
Reference 62
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 63885804-d288-4ca1-8b29-3120d5f3bbb7 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Adaplanner: Adaptive planning from feedback with language models
Reference 63
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 1422e5ea-66b1-4c5c-a413-2140fe4971c7 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents
Reference 64
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3dea4ca2-8cb5-4bab-86eb-6682c8a0f0df · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gemini: A Family of Highly Capable Multimodal Models
Reference 65
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c06f7733-5606-497f-b940-5ca77cae9725 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Sutton, David A
Reference 66
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 97cc24de-8bd8-4ec4-86d2-295bea05cfc9 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Musique: Multihop questions via single-hop question composition.Trans.Assoc
Reference 67
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0dd2da24-b3b8-4530-8314-5657515611b5 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Reft: Reasoning with reinforced fine-tuning
Reference 68
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 532e615f-3a21-40bf-a4db-9cb23d09deb2 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Kimi k1.5: Scaling Reinforcement Learning with LLMs
Reference 69
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 265a9530-001d-4455-8cb1-959fd7aa7d00 · outbound
Reference 70
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 9683a1b6-ce25-46b5-95c3-cbb4338ace2d · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
Reference 71
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4ab9bbf9-4a66-47db-9ce0-ada5f3d3fb59 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Jansen, Marc-Alexandre Côté, and Prithviraj Ammanabrolu
Reference 72
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ae062941-d08d-493b-8c08-577757bfd82d · outbound
Reference 73
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0d24e350-83ed-458c-ac11-aedca08b0180 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation
Reference 74
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 95356520-f7dc-4c93-9e37-f41cd17eef1b · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents
Reference 75
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation bf255e61-772a-47ca-b0fa-3d0bbf8246a1 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Training large language models for reasoning through reverse curriculum reinforcement learning
Reference 76
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 1d53ab70-2c84-4fb0-972c-54d9354c5c59 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AgentGym: Evolving Large Language Model-based Agents across Diverse Environments
Reference 77
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8077fde1-54f2-4cdd-bf6e-7fa50af5084a · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work
Reference 78
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 2606dce6-2272-4fd5-99c9-ebe1c71a362c · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The rise and potential of large language model based agents: a survey
Reference 79
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b6a6cc2f-9582-4d9f-b2ef-4ddeb37530f8 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Inverse-q*: Token level reinforcement learning for aligning large language models without preference data
Reference 80
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 4e4d0ea8-cdb9-45dd-8b92-9db67b2b7a05 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision
Reference 81
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 39b4f6fe-10dc-468c-8232-5793c76ea01a · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Teaching language models to critique via reinforcement learning.CoRR, abs/2502.03492, 2025
Reference 82
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fe637a45-7df9-4646-a616-084cd27712d8 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwen2.5 Technical Report
Reference 83
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4d27eee0-bc0a-4db3-b455-7488bf2f5ce3 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Self-evaluation guided beam search for reasoning
Reference 84
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 42973a9a-fadf-4a85-837a-9fa5934bd73a · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Cohen, Ruslan Salakhutdinov, and Christopher D
Reference 85
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ff00ba3d-15ef-4527-b494-59e0ae432c26 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Language Agents: From Next-Token Prediction to Digital Automation
Reference 86
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 86b114ba-b299-4ec5-bb13-bf18ce27975e · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwen3 Technical Report
Reference 87
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e3300ea8-c0a7-4223-a3e8-c653c3aa1b5c · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Narasimhan, and Yuan Cao
Reference 88
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation be99b73b-b1c7-4786-afd4-c5af248cafcf · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use
Reference 89
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 256e425d-08c8-40a3-bf98-6e352a98bd6c · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Webshop: Towards scalable real-world web interaction with grounded language agents
Reference 90
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 5af19426-01d6-4d0c-a8fb-789ccc4fdaea · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Agenttuning: Enabling generalized agent abilities for llms
Reference 91
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 48bef6c8-d0a6-444e-b1eb-ce4f4192a8b8 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning
Reference 92
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a2cf32f5-2ede-4cc9-8f31-e8fa9b291fa4 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use
Reference 93
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dc31d1eb-0dd3-4546-97cc-a6c0b41e4e30 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig
Reference 94
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 60b2c832-1e32-4ef0-bd2c-ed49b1fe3cf4 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Archer: Training language model agents via hierarchical multi-turn RL
Reference 95
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation f73c0b1f-224b-4ba7-9ebb-7647afcba7e9 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Secrets of RLHF in Large Language Models Part I: PPO
Reference 96
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation be068867-1ea1-4f98-a8ad-db57b7ccc02f · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Deductive Beam Search: Decoding Deducible Rationale for Chain-of-Thought Reasoning
Reference 97
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 008c251b-39bb-4631-92c4-a88dcfc3073f · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Scaling Test-time Compute for LLM Agents
Reference 99
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7e4e754a-856d-4c40-b5a5-b1811875037a · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work
Reference 108
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation d791954a-b009-47fe-b3ee-636efe0335d6 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Catalog Price Rule
Reference 361
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 3b9a8633-9adb-482a-97a8-879cc7197443 · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work
Reference 2018
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 78edf6f1-8561-4f74-ba85-cf6c5240871c · outbound
AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work
Reference 2023
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 02f62de8-51c4-4717-824a-9f454d01bcf1 · inbound
DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ab033493-353e-4c3c-86e5-a01590349bc5 · inbound
From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 64
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 1bac4949-4614-4099-84cb-bf272862a396 · inbound
Graph-Enhanced Policy Optimization in LLM Agent Training AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 65ecc095-b3c4-4c04-8fd5-45bd71d0c2f1 · inbound
No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 18
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 521c8bd2-31d2-4ddf-bc5f-0bfa840077e2 · inbound
SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 62076d23-5f87-47e3-b40e-a118ffdc1d62 · inbound
HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 56
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 80e94209-9660-4f03-9d68-3a17f887eee7 · inbound
Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 99
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation a0a00fb7-0848-4b85-af89-ff144e01af2a · inbound
Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 3f2fe3ee-5043-4fd1-86a5-ce7f9e1e0052 · inbound
Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation d56ae31f-1127-4d63-8d06-b6f79feefa8a · inbound
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 38
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 62f24da8-3e94-423f-9baa-ad1e2f5b43ee · inbound
StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 1e85163d-8550-442e-9751-e64bd6830b91 · inbound
Weblica: Scalable and Reproducible Training Environments for Visual Web Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 8088afa4-dd0d-4fa3-8c33-a1292a4c46b5 · inbound
AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 56
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation a6a7d221-1648-47b6-aefe-2964ec339729 · inbound
AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 56
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation f9d5f345-c44a-4e88-8985-0fe8803df340 · inbound
GRAFT: Graph-Tokenized LLMs for Tool Planning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation d857d5c2-67c7-46cb-a55c-bc15d944de6b · inbound
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 43
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 199a2e9b-eb9a-4a3a-940b-4e6a27353c78 · inbound
Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 84
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 72827b3b-f976-4a54-9e0e-970c19d50e4d · inbound
PriorZero: Bridging Language Priors and World Models for Decision Making AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 468889c8-af3e-4213-baa3-d9b4c468334a · inbound
Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation e1ac94f0-db25-4541-9ebc-593bb43dfd4e · inbound
ICRL: Learning to Internalize Self-Critique with Reinforcement Learning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation b59c1e80-b311-4087-a119-9dbbe090a57a · inbound
Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 8d583fbf-e3c7-403d-b117-3b59177e3305 · inbound
SkillGrad: Optimizing Agent Skills Like Gradient Descent AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 1
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.
Observation 6b1e739c-bb86-4664-9402-992f048bad50 · inbound
Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 763e6f28-3062-4056-96fa-b9052d9b42fb · inbound
From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 2018
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1a45e017-0649-429c-b45c-3054a1e94154 · inbound
From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1934517f-cac9-4a64-9ac3-74851e6dce68 · inbound
When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4e2c48f9-e951-48b3-8d4a-71238d638059 · inbound
SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.