Pith. sign in

Paper Citation Record · LEDGER

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

As of 19 August 2026, this Paper Citation Record lists 100 of 101 outbound references and 27 inbound Pith citation observations for arXiv:2509.08755.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.08755 v1

Coverage vector

measured 100 of 101 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T16:08:42.904325Z

measured 127 of 127 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 27 of 27 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T15:49:16.072327Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

100 of 101 outbound references displayed

  • verified exact2
  • verified fuzzy17
  • unresolved77
  • parse uncertain1
  • malformed identifier3
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation c05bde1c-daba-41ab-858c-d56e8af08986 · outbound

This paper cites GPT-4 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:37.600517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.600517Z digest=sha256:3ef91679d0c7cb2a84b7f244ae67c5c769cbc0e0f5abb801fd87d35e0ce8f879

Observation 49032693-a826-4a29-9457-6506e9a5e2b7 · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 1(1):4, 2024.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The claude 3 model family: Opus, sonnet, haiku.Claude-3 Model Card, 1(1):4, 2024

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:37.630983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.630983Z digest=sha256:255803a3ff646bb51ac00ec8ef107b34d669293de3a7f9b8b490513cbe61c0b9

Observation f7dbd590-1d6a-413f-99a3-77c5ad84036a · outbound

This paper cites Gonzalez, and Ion Stoica.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gonzalez, and Ion Stoica

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:37.682626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.682626Z digest=sha256:be27875b5cd02b3fc0653cb943f513f509bf56635e3f778f86d5ab935e473c07

Observation f45c9255-87da-4228-b342-8b599bef5c8f · outbound

This paper cites FireAct: Toward Language Agent Fine-tuning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning FireAct: Toward Language Agent Fine-tuning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:37.751164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.751164Z digest=sha256:e58048af497fa9194c302d7f7e636d1b8725c8d1ad80dfb0ff4dd649fcbad92d

Observation ed751628-26f4-40fc-9c7c-eb9e32f6c7c4 · outbound

This paper cites Improving discriminative capability of reward models in RLHF using contrastive learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Improving discriminative capability of reward models in RLHF using contrastive learning

Reference 5

Resolution
malformed identifier
no resolver link, observed 2026-08-15T16:08:37.915657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:37.915657Z digest=sha256:ac9ecfb7685103d90b7e3d8bef1991b8519f62949e8dcd46f78b66a3f35ad8b1

Observation 86434bf1-b516-4191-8f16-b879b95b0f87 · outbound

This paper cites Agent-flan: Designing data and methods of effective agent tuning for large language models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Agent-flan: Designing data and methods of effective agent tuning for large language models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.024095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.024095Z digest=sha256:6b455cf0699d8a8e80493b7b8e57fc90a811daf0c6e40f1d0df3e58bb1e83f99

Observation ed35ed01-0716-4185-a42a-23a285b0ef14 · outbound

This paper cites Babyai: A platform to study the sample efficiency of grounded language learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Babyai: A platform to study the sample efficiency of grounded language learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.116032Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.116032Z digest=sha256:f33c29951274624c8a4c3c8c4826f25fd6d095361ee92956dc5ecc1f889e3284

Observation e79c8b03-2825-4e4e-9cf0-33bd564a9038 · outbound

This paper cites SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning SELA: Tree-Search Enhanced LLM Agents for Automated Machine Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.247786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.247786Z digest=sha256:45c4c6609f7fcf212c815135a54aabfe83e0b93ed6411aed053d3e3289affb14

Observation dc9bb8dd-b2ff-4467-85c6-aa5607682a42 · outbound

This paper cites Inference-aware fine-tuning for best-of-n sampling in large language models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Inference-aware fine-tuning for best-of-n sampling in large language models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.418085Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.418085Z digest=sha256:e23a0f0aab06d47386ff9ecd77802c8d71d1a60e6c38eeac637f03b292ceec55

Observation f2ecc788-fdaf-421e-9f15-07790ea41ba4 · outbound

This paper cites Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.516895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.516895Z digest=sha256:4b0e6ec3dc39a026d08e024bedc460ad29cb52799fe2ecaa46ee3e012520fc7d

Observation a8372011-820b-4c2e-be2d-9f100e52ecb5 · outbound

This paper cites DeepSeek-V3 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeek-V3 Technical Report

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.670192Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.670192Z digest=sha256:3549ba0526563af16000917fa51f0fb931a93eb8a894e801c5b17adfdc3b6ec9

Observation 1b8af236-0990-4b07-a26f-057d2e69a667 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.677413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.677413Z digest=sha256:2c44ff5635c89ccf116f1a47d2588a541c0a9b7d7e684df82dd27efb094e01eb

Observation 5e6eaf16-555d-4dd0-a9fb-d6ffb8d728e6 · outbound

This paper cites Mind2web: Towards a generalist agent for the web.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Mind2web: Towards a generalist agent for the web

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.719770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.719770Z digest=sha256:21bbbaaf4feb73ad774703935a4de5c98e1338b662b614b0cb6e6e5ced961f1e

Observation e8fdb23b-6492-4fe3-94fa-30db71a195c5 · outbound

This paper cites The Llama 3 Herd of Models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The Llama 3 Herd of Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.790498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.790498Z digest=sha256:dc4e6850b1fc19211585f8350bf6f8f8c45a85b3bf8c9160b2a047e8d97d1164

Observation d7627416-45e8-4088-88d1-72b8d982b0bc · outbound

This paper cites Minedojo: Building open-ended embodied agents with internet-scale knowledge.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Minedojo: Building open-ended embodied agents with internet-scale knowledge

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.795430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.795430Z digest=sha256:6c7300f4c006390b7c6ed07306607ae04222df7a539a698d1cc688722a1d87b4

Observation b213f8a0-2881-4799-be1d-a01b14a50df5 · outbound

This paper cites MASTER: A multi-agent system with LLM specialized MCTS.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning MASTER: A multi-agent system with LLM specialized MCTS

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.816713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.816713Z digest=sha256:d778b248c161572eb71227fa0f3b879b354707e45ed11dc17e17c6f7d40817de

Observation 530ccc16-1a6b-4563-9874-f3d5ff548979 · outbound

This paper cites CritiQ: Mining Data Quality Criteria from Human Preferences.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning CritiQ: Mining Data Quality Criteria from Human Preferences

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.840373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.840373Z digest=sha256:1d644d2eb06bd1ab7472bc1c030652ddea14529960cde19b7cd4e43ea969d27c

Observation 2205a3cc-2d4d-4173-85bb-e2314cd0add3 · outbound

This paper cites Skywork Open Reasoner 1 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Skywork Open Reasoner 1 Technical Report

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.846484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.846484Z digest=sha256:9939222db072433e318db694871ee9ad422768361d0287e6f2ba95771e1ecbc8

Observation c344a969-57c9-451e-a85f-76a326e8ccab · outbound

This paper cites Constructing A multi-hop QA dataset for comprehensive evaluation of reasoning steps.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Constructing A multi-hop QA dataset for comprehensive evaluation of reasoning steps

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.851741Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.851741Z digest=sha256:ba987791aaa6cb99e7ccc04c3e9ee90b4316fb307c77f6ac96412e459cb60ffc

Observation e50dbf88-be7a-4933-ab4e-144c6aba55e3 · outbound

This paper cites Metagpt: Meta programming for A multi-agent collaborative framework.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Metagpt: Meta programming for A multi-agent collaborative framework

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.880006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.880006Z digest=sha256:8a2f9a09be26b6e99562c74178c0b97c2cb2589ed8347e4484042a2b696bde17

Observation e6223821-3664-4649-a17a-33fb68b3761a · outbound

This paper cites REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.975341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.975341Z digest=sha256:377441ee4dc4d205758b4836c1cf279a4f99a3137efc52bc8327c0c464df47cd

Observation 111f82ab-f716-4c46-b9bf-fb68df4df0b2 · outbound

This paper cites GPT-4o System Card.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4o System Card

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.980026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.980026Z digest=sha256:1c74552b6f1e9680612bdacdb47d58e5e2085fbd49a68153ef3a3b043e73c66f

Observation 376527cd-9e01-411c-9ef1-b4174222c4a5 · outbound

This paper cites OpenAI o1 System Card.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning OpenAI o1 System Card

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.984341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.984341Z digest=sha256:672d33bef5f698620cae650960f20fd45b71c139da270f7fde9e8b021c7daf9e

Observation 53c100a1-18f2-4289-8aa7-e1bdba625018 · outbound

This paper cites AI Alignment: A Comprehensive Survey.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AI Alignment: A Comprehensive Survey

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.072868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.072868Z digest=sha256:8fd146637eac425daf6da86fd1b3efbb39fb4fc1f7bd6e2eba4579138f5ad234

Observation 6252f0a3-8341-473e-9c5e-a6ab0203c525 · outbound

This paper cites An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.097595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.097595Z digest=sha256:47cf7e432a9b6b30e5dd66dfa95103e812fded525a6a98f816fe1544b897e9f7

Observation 42ea67a9-d00d-477f-af5c-5db7e70c5703 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.103533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.103533Z digest=sha256:3b9125dc5df8030700cc85ed8b4ee8b6c0b94a444a51749103e00f8436c0cd22

Observation 4a25a3e2-e9f6-4264-8b77-1bdda9d6d28e · outbound

This paper cites Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Regularized Best-of-N Sampling with Minimum Bayes Risk Objective for Language Model Alignment

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.194910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.194910Z digest=sha256:f6f2e7341e1a4373c61a209bc608d8f69c06ba3ca6e84a9b34b69cc4eb0b7397

Observation 5929d08b-6932-4434-acfe-716666a3bbc7 · outbound

This paper cites Weld, and Luke Zettlemoyer.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Weld, and Luke Zettlemoyer

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.200134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.200134Z digest=sha256:0594597c13af03973920386745a5cde194c87798ecfa4fe6436042c0eeef2950

Observation 4fab054a-dddf-448e-9ad1-9677d8bcab3d · outbound

This paper cites Buy 4 REINFORCE samples, get a baseline for free! InDeep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, New Orleans, Louisiana, United States, May 6, 2019.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Buy 4 REINFORCE samples, get a baseline for free! InDeep Reinforcement Learning Meets Structured Prediction, ICLR 2019 Workshop, New Orleans, Louisiana, United States, May 6, 2019

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.209485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.209485Z digest=sha256:160383c85f746b1f3cdb824be399b7b1e16cefbdeefd641566e7d713c511f63d

Observation dd9332c2-98fa-4616-a708-bab05710d2cf · outbound

This paper cites Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Co-Reyes, Avi Singh, Kate Baumli, Shariq Iqbal, Colton Bishop, Rebecca Roelofs, Lei M

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.254624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.254624Z digest=sha256:ff4b3d602627cfbabb45aed0589f62eeb366d9576df9c91274e6ff4d59754981

Observation a0738f59-79e2-4968-9655-480a767e8fcd · outbound

This paper cites More agents is all you need.Trans.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning More agents is all you need.Trans

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.304390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.304390Z digest=sha256:08fd5ec92e5048b61d4d20bd2bf0da2e37ab90e344c701db37cbb22fa8d5fc2f

Observation f7809971-b5cd-467e-aea9-edc65795bce4 · outbound

This paper cites Encouraging divergent thinking in large language models through multi-agent debate.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Encouraging divergent thinking in large language models through multi-agent debate

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.309173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.309173Z digest=sha256:7dcd21c7343773d16fe7bbcec811e86147d7e14baab736217280e7507722d982

Observation b7f86344-60f1-4f52-bd54-944b461c78a0 · outbound

This paper cites Liu, and Jialu Liu.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Liu, and Jialu Liu

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.315407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.315407Z digest=sha256:a6b9c855ff6d83492ab7e005ea57d9ae1ec36587547b74399924ba5e9549a146

Observation 55ebdc1b-1191-4e32-8427-e3c785c9369f · outbound

This paper cites BOLAA: Benchmarking and Orchestrating LLM-augmented Autonomous Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning BOLAA: Benchmarking and Orchestrating LLM-augmented Autonomous Agents

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.320645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.320645Z digest=sha256:c4bc96f8fb9fd3056cc7015409fd495cc7cf78aac2a4452735ae2a67c01b825f

Observation d92eb505-e877-47e4-987e-cd492bb7f1c5 · outbound

This paper cites Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.379007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.379007Z digest=sha256:2f92b235d0cc1cb96f0c765a936f3c80468343d904f857cbf61d0bee11f60b39

Observation 15731945-d2eb-4750-b3c3-2ceb611e86b6 · outbound

This paper cites When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.417051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.417051Z digest=sha256:1916136c3c7d9dda013d11838b57ce6d908327da98ddb8c1159e5da79fa9f5ad

Observation b7138712-6bd5-4117-b8c0-f178d9bf9133 · outbound

This paper cites Kimi k2: Open agentic intelligence.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Kimi k2: Open agentic intelligence

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.422031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.422031Z digest=sha256:80c49c36b761ab4f61fa0cc878a52961f051550c6e646be66db246fc947b63e1

Observation ce435bc5-a146-41d3-a9c4-f770f8031dc7 · outbound

This paper cites Long-horizon planning for multi-agent robots in partially observable environments.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Long-horizon planning for multi-agent robots in partially observable environments

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.426769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.426769Z digest=sha256:4dafe1cb030b2eb339cf312e5078c6b471fa29be0007471384a90da0abfc741e

Observation 36bf6acb-606e-47f3-9aac-e4e9d6176570 · outbound

This paper cites GPT-4 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning GPT-4 Technical Report

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.431704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.431704Z digest=sha256:f63ce15b0e0be762e35a4797aaae467c1a43d2aa1ea36984fe79d32a95c944e4

Observation 47240b98-5128-4d14-b8e2-2f03074258c1 · outbound

This paper cites Openai o3 and o4-mini system card.https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758 f3722c1/o3-and-o4-mini-system-card.pdf , 2025.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Openai o3 and o4-mini system card.https://cdn.openai.com/pdf/2221c875-02dc-4789-800b-e7758 f3722c1/o3-and-o4-mini-system-card.pdf , 2025

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.519858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.519858Z digest=sha256:17dfa36ca631f4f7b201d6840021aa4d60de2e795eb492a247250a5bae842982

Observation 5e3fe7b8-b4da-4fb0-a8df-baded709a4a4 · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.524212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.524212Z digest=sha256:6cdb1033a015d896a9208258c6dea8b6811acb83aff7ef2c70faa3aa0811e5e3

Observation 321eaa35-7b2d-474d-8950-07ffb70bdcdf · outbound

This paper cites Instruction Tuning with GPT-4.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Instruction Tuning with GPT-4

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.528674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.528674Z digest=sha256:1829984d53d545cddaac92d1c0faecbfdd9d4dfc6308ceeccd9d5d49d70dbb5c

Observation 9b764c18-7e86-434b-a960-41adf7aa6d7d · outbound

This paper cites Adapt: As-needed decomposition and planning with language models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Adapt: As-needed decomposition and planning with language models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.533278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.533278Z digest=sha256:d15fc26c7b9b8636c019d1f821dc14bd4639a7fb9ac06bbe1173d243304bcf37

Observation 66b95654-95a8-4cf7-94a1-3ca5e94da924 · outbound

This paper cites Smith, and Mike Lewis.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Smith, and Mike Lewis

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.601912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.601912Z digest=sha256:e09518f7e140c1f9d6aa274e41fc9542e24820f56e05dc9c31dd859ef9aabde4

Observation 4001e3d7-f7fa-4c3d-949a-d1c204ddf3f7 · outbound

This paper cites Webrl: Training LLM web agents via self-evolving online curriculum reinforcement learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Webrl: Training LLM web agents via self-evolving online curriculum reinforcement learning

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.694720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.694720Z digest=sha256:a4eac56699e76df24745e6b3531c7b47f736837eb9d6849500b077d187904ce5

Observation c5ef7cff-6d59-4efa-a6bf-4c3b4a9d8348 · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.817846Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.817846Z digest=sha256:b37019816a69c3cb134e21c737ed7428b2912283df8a0058dba8ce8d62234897

Observation 0b3685b8-ed08-4a38-87d0-4e7e501a990d · outbound

This paper cites Qwq-32b: Embracing the power of reinforcement learning, March 2025.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwq-32b: Embracing the power of reinforcement learning, March 2025

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:48.090772Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:39.898665Z digest=sha256:7afb8a6fb6866283b313827cac59b9acec52e668f3c133320354d78501e53a79

Observation 9291ba2a-da47-456c-a360-ff861717daa1 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Manning, Stefano Ermon, and Chelsea Finn

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.816003Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.047019Z digest=sha256:f1b81f6d3b5ee8219a7e95cc0ff29d66a2d2cc11875455526fb2f20a541b4c6b

Observation cc80a67f-3fc9-4482-8598-a56495206e19 · outbound

This paper cites Self-Reflection in LLM Agents: Effects on Problem-Solving Performance.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Self-Reflection in LLM Agents: Effects on Problem-Solving Performance

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.106049Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.106049Z digest=sha256:ffd79fe8da2fd9e4344ed132b9b24c82cd1886425866a2002cb55f886c9c4914

Observation 9a93ac67-fd24-4d93-a7c1-13618bbab08e · outbound

This paper cites Jordan, and Philipp Moritz.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Jordan, and Philipp Moritz

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.725755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.111338Z digest=sha256:cd1d66f13500ece69fa83f411116303c74a6a7460eb88c38757cdf6ec911eb7f

Observation 3628a375-f5b5-4de0-9c05-72ff6564ba58 · outbound

This paper cites Proximal Policy Optimization Algorithms.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.117952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.117952Z digest=sha256:2ac7996b43eff14dbb866e6e14c4b7c5ea704d93515fd9424532a06f0dc9c8d7

Observation adb5e41d-7329-459e-b544-53531c9a35ac · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.219723Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.219723Z digest=sha256:8a8b5f466ab91a12aa085eb424e8049daf14c8ef35db52d17ef017a35525e265

Observation 81c7e9db-2afa-4e3c-b41f-20ce6ca35031 · outbound

This paper cites Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.225533Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.225533Z digest=sha256:710c1189fb068a1b3dca229f83838126a36e81bc6cc4d83a7a952a83a3918560

Observation 1b9fe2dc-42ba-49ab-b6bd-55913403c21e · outbound

This paper cites Hybridflow: A flexible and efficient RLHF framework.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Hybridflow: A flexible and efficient RLHF framework

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.230219Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.230219Z digest=sha256:9e264401179115ae2ccdbde76583b3db3058dae391042b9776151d95a214c0d6

Observation c11cf04b-2b0a-468a-8847-9ae872096c58 · outbound

This paper cites Reflexion: language agents with verbal reinforcement learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Reflexion: language agents with verbal reinforcement learning

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.606687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.333561Z digest=sha256:da7f0f95aa2142836306d2f312834e19ecce2626b13ba5c206c8b26aac17ae17

Observation fdf115c4-19aa-4508-93da-604656978bf9 · outbound

This paper cites Hausknecht.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Hausknecht

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.333232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.483374Z digest=sha256:4991bf6b519ed8011711666586b2f97f286120f91fc96ce68f5d989ee2ad7f57

Observation 31498db6-3b98-4ac0-8bc3-6f23664490a5 · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:08:47.519366Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.389507Z digest=sha256:d05e46f00c5e8dbb9c0d767023444beedc274f65495149cab7a2c955c60bb56a

Observation 8f7a4cf1-50f9-4d7f-a561-8f4e715ce3b0 · outbound

This paper cites PaperBench: Evaluating AI's Ability to Replicate AI Research.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning PaperBench: Evaluating AI's Ability to Replicate AI Research

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.493997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.493997Z digest=sha256:13df6e758be38b4cb63504b92adc313e43ecb4f85bf4581edfd9ccf628663f68

Observation 006026b6-3723-4002-9bce-af7a72e9acd1 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.488720Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.488720Z digest=sha256:342f095b91d6b3180dbc152efdc2a612e983ffec6f685f908a83859d0d653de7

Observation 03106ecc-edab-42a8-a294-27719c248ed9 · outbound

This paper cites Sutton and Andrew G.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Sutton and Andrew G

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.009894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.504753Z digest=sha256:2d30450297f16e3f482e41fda59a709bb96585f5270d5b35b5e36387939d2bdb

Observation 63885804-d288-4ca1-8b29-3120d5f3bbb7 · outbound

This paper cites Adaplanner: Adaptive planning from feedback with language models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Adaplanner: Adaptive planning from feedback with language models

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:47.130353Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.499030Z digest=sha256:b254266fa9d43af40ea5cca31410a6408b582d6147b62944ca6d24bfa6d8bd86

Observation 1422e5ea-66b1-4c5c-a413-2140fe4971c7 · outbound

This paper cites Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Multi-Agent Collaboration: Harnessing the Power of Intelligent LLM Agents

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.624630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.624630Z digest=sha256:808200329449590c9bdf149ef72c7c56be5516f21d6ad7c80e91d112ef767981

Observation 3dea4ca2-8cb5-4bab-86eb-6682c8a0f0df · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Gemini: A Family of Highly Capable Multimodal Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.740394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.740394Z digest=sha256:a72c229bbf13c90230786785d48a46b983d18a2f7b0c08ac4b1171e1946d9b18

Observation c06f7733-5606-497f-b940-5ca77cae9725 · outbound

This paper cites Sutton, David A.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Sutton, David A

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:46.562456Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.618864Z digest=sha256:6112148e90694cf8f65b725752eadf271d4c0d50f3af592858d495280e256b71

Observation 97cc24de-8bd8-4ec4-86d2-295bea05cfc9 · outbound

This paper cites Musique: Multihop questions via single-hop question composition.Trans.Assoc.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Musique: Multihop questions via single-hop question composition.Trans.Assoc

Reference 67

Resolution
malformed identifier
no resolver link, observed 2026-08-15T16:08:40.842451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.842451Z digest=sha256:88965ad3e11f834faf90bca6e710091b33f5d3a27a33ae65e440ef4d49a3594f

Observation 0dd2da24-b3b8-4530-8314-5657515611b5 · outbound

This paper cites Reft: Reasoning with reinforced fine-tuning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Reft: Reasoning with reinforced fine-tuning

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.898413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.898413Z digest=sha256:9a6fbcd0017a3dae8d631eb24080f99ffd15d3a0dd6aaf51e84a3998af94fd3f

Observation 532e615f-3a21-40bf-a4db-9cb23d09deb2 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.805045Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.805045Z digest=sha256:dfdfa03385d221c98a5bddc5a3aef327c60014f83d395e5e344c758b1c376f3f

Observation 265a9530-001d-4455-8cb1-959fd7aa7d00 · outbound

This paper cites Le, Ed H.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Le, Ed H

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:46.341534Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:41.017873Z digest=sha256:0b0670c499a2f42ffcbc105f1250142b2da839358f1575f7c803dde69d0b0cd9

Observation 9683a1b6-ce25-46b5-95c3-cbb4338ace2d · outbound

This paper cites RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.102876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.102876Z digest=sha256:956d9fcca35494c838e58d389bf5a04580bbed34ec1176059c691760432409d7

Observation 4ab9bbf9-4a66-47db-9ce0-ada5f3d3fb59 · outbound

This paper cites Jansen, Marc-Alexandre Côté, and Prithviraj Ammanabrolu.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Jansen, Marc-Alexandre Côté, and Prithviraj Ammanabrolu

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:40.903651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:40.903651Z digest=sha256:10cdeb7c108f39acf8b80cc329c204c9d367f1bc5c38924f28daefb2dd7defff

Observation ae062941-d08d-493b-8c08-577757bfd82d · outbound

This paper cites Williams.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Williams

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.296247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.296247Z digest=sha256:7c4cd7206d6883b2ff8edbcf8ba04496da86807d82edcc0cf341b8a5af14858d

Observation 0d24e350-83ed-458c-ac11-aedca08b0180 · outbound

This paper cites AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.381835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.381835Z digest=sha256:256b6c13f226610f564395e525ceccc75eddc38c21b79d4b6428de09c4188d7c

Observation 95356520-f7dc-4c93-9e37-f41cd17eef1b · outbound

This paper cites BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.200957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.200957Z digest=sha256:b300e5dcd4d1c0b9f617869f540626963509eb7409ec761b0f02f0a98b05a7dc

Observation bf255e61-772a-47ca-b0fa-3d0bbf8246a1 · outbound

This paper cites Training large language models for reasoning through reverse curriculum reinforcement learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Training large language models for reasoning through reverse curriculum reinforcement learning

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.885089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:41.458791Z digest=sha256:30546d4588af4f5959b3bed9a5bb86c0ae4133022828beff4d3e0eb8fb8581e8

Observation 1d53ab70-2c84-4fb0-972c-54d9354c5c59 · outbound

This paper cites AgentGym: Evolving Large Language Model-based Agents across Diverse Environments.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AgentGym: Evolving Large Language Model-based Agents across Diverse Environments

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.489376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.489376Z digest=sha256:8ba746ee7cc8d3a8e75b983194c553481049d3e0f22fc3a178b20e19ae933ce1

Observation 8077fde1-54f2-4cdd-bf6e-7fa50af5084a · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 78

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:08:46.157653Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:41.387710Z digest=sha256:d8d51a0644fbf0e6b17a31a54891aa29209500e91774d47e68794f7fe4eb6b89

Observation 2606dce6-2272-4fd5-99c9-ebe1c71a362c · outbound

This paper cites The rise and potential of large language model based agents: a survey.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning The rise and potential of large language model based agents: a survey

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.500771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.500771Z digest=sha256:3417f97078ebc75d50d7e1c93d097626cc2c6d938fa77a1d111278a9bb136301

Observation b6a6cc2f-9582-4d9f-b2ef-4ddeb37530f8 · outbound

This paper cites Inverse-q*: Token level reinforcement learning for aligning large language models without preference data.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Inverse-q*: Token level reinforcement learning for aligning large language models without preference data

Reference 80

Resolution
verified exact
doi, observed 2026-08-15T16:08:43.458973Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:41.579580Z digest=sha256:ef7133835dd3dd73a29fce452db508b594f85f28884e9f59094df68e9bc10138

Observation 4e4d0ea8-cdb9-45dd-8b92-9db67b2b7a05 · outbound

This paper cites Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.494963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.494963Z digest=sha256:14ba8872e5c57c1ef525378071a7c851d5706ca365635c817e5a2d9a6652a1bb

Observation 39b4f6fe-10dc-468c-8232-5793c76ea01a · outbound

This paper cites Teaching language models to critique via reinforcement learning.CoRR, abs/2502.03492, 2025.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Teaching language models to critique via reinforcement learning.CoRR, abs/2502.03492, 2025

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.590120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.590120Z digest=sha256:f11737d3c57dc2a396fc74acf11fb4503852a93fcca778e2bca3a9d353bd2b35

Observation fe637a45-7df9-4646-a616-084cd27712d8 · outbound

This paper cites Qwen2.5 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwen2.5 Technical Report

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.650422Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.650422Z digest=sha256:0c4d455e76affac6827d83937716640eff045335ca1b4eedc81a7eabf8700a2b

Observation 4d27eee0-bc0a-4db3-b455-7488bf2f5ce3 · outbound

This paper cites Self-evaluation guided beam search for reasoning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Self-evaluation guided beam search for reasoning

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.673240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:41.584987Z digest=sha256:1d281aae69990554ec438c0d89f4e3655fe0b256cd2a40e30ab649734089a1cb

Observation 42973a9a-fadf-4a85-837a-9fa5934bd73a · outbound

This paper cites Cohen, Ruslan Salakhutdinov, and Christopher D.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Cohen, Ruslan Salakhutdinov, and Christopher D

Reference 85

Resolution
malformed identifier
no resolver link, observed 2026-08-15T16:08:41.707152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.707152Z digest=sha256:ded2dd1f34ceecc0968a65e4461a760988a60c4fca4cb96f9665f0a352713e1c

Observation ff00ba3d-15ef-4527-b494-59e0ae432c26 · outbound

This paper cites Language Agents: From Next-Token Prediction to Digital Automation.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Language Agents: From Next-Token Prediction to Digital Automation

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.390030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:41.711910Z digest=sha256:3819a3477ee346c5632b94e8032ac2f2204c1fab940c271328adc37ec0539938

Observation 86b114ba-b299-4ec5-bb13-bf18ce27975e · outbound

This paper cites Qwen3 Technical Report.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Qwen3 Technical Report

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.701294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.701294Z digest=sha256:39a0ccfbc9c3a6d911c10345beb865af10a6aafb45401bf365cdf8eacad323a5

Observation e3300ea8-c0a7-4223-a3e8-c653c3aa1b5c · outbound

This paper cites Narasimhan, and Yuan Cao.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Narasimhan, and Yuan Cao

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.053916Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:41.804333Z digest=sha256:f549f93a22dc39706c04dc697c19587dbfe7442bcd6271cb52a08e7c4346ab3c

Observation be99b73b-b1c7-4786-afd4-c5af248cafcf · outbound

This paper cites TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning TL-Training: A Task-Feature-Based Framework for Training Large Language Models in Tool Use

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.926916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.926916Z digest=sha256:7e2b2b0cad27af7edcc36e9693d1b144a8fad6b5c275605c98b9238f67aa736c

Observation 256e425d-08c8-40a3-bf98-6e352a98bd6c · outbound

This paper cites Webshop: Towards scalable real-world web interaction with grounded language agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Webshop: Towards scalable real-world web interaction with grounded language agents

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:45.254321Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:41.717784Z digest=sha256:a2c6630809117344664840daadcebc8dd805f08b99833d7fb2c658714b6b0a65

Observation 5af19426-01d6-4d0c-a8fb-789ccc4fdaea · outbound

This paper cites Agenttuning: Enabling generalized agent abilities for llms.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Agenttuning: Enabling generalized agent abilities for llms

Reference 91

Resolution
verified exact
doi, observed 2026-08-15T16:08:43.224466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:42.053976Z digest=sha256:a869bc7d49178abb429fdb355eb8f184d511d498826e6af08b24708934133be5

Observation 48bef6c8-d0a6-444e-b1eb-ce4f4192a8b8 · outbound

This paper cites AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning AgentOhana: Design Unified Data and Training Pipeline for Effective Agent Learning

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:42.143756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:42.143756Z digest=sha256:5592518e19c0f690308e28121906956a28eeadb08f1b0218236695efe40da703

Observation a2cf32f5-2ede-4cc9-8f31-e8fa9b291fa4 · outbound

This paper cites ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:41.989075Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:41.989075Z digest=sha256:622488969b05fa222ba291b64a05229b9e8dd9c29da96d7b24cdd6f2df5330aa

Observation dc31d1eb-0dd3-4546-97cc-a6c0b41e4e30 · outbound

This paper cites Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:44.943340Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:42.303584Z digest=sha256:8ba514d1bec13559e5b2e0780f67ef23347c5f424191b6d7dedfbe85cfe40f20

Observation 60b2c832-1e32-4ef0-bd2c-ed49b1fe3cf4 · outbound

This paper cites Archer: Training language model agents via hierarchical multi-turn RL.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Archer: Training language model agents via hierarchical multi-turn RL

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:44.678860Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:42.424153Z digest=sha256:fb2f492abe88409bd30e89bf99245a2961c95f289ab93521a91659fcd36c0184

Observation f73c0b1f-224b-4ba7-9ebb-7647afcba7e9 · outbound

This paper cites Secrets of RLHF in Large Language Models Part I: PPO.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Secrets of RLHF in Large Language Models Part I: PPO

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:42.217316Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:42.217316Z digest=sha256:21588864803c8776d939686d11dc5b161b8625ad045a5e431a52197d3be32ed9

Observation be068867-1ea1-4f98-a8ad-db57b7ccc02f · outbound

This paper cites Deductive Beam Search: Decoding Deducible Rationale for Chain-of-Thought Reasoning.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Deductive Beam Search: Decoding Deducible Rationale for Chain-of-Thought Reasoning

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:42.642649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:42.642649Z digest=sha256:0507c9f7dd4dc5845e1d03743a2456745835d0e9462ebacbf007edef9a1050a4

Observation 008c251b-39bb-4631-92c4-a88dcfc3073f · outbound

This paper cites Scaling Test-time Compute for LLM Agents.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Scaling Test-time Compute for LLM Agents

Reference 99

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:42.543273Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:42.543273Z digest=sha256:7d504b14f0a347c9d939a1c7cba7b8d5959664ebf82271d63d83cc68536caeca

Observation 7e4e754a-856d-4c40-b5a5-b1811875037a · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 108

Resolution
parse uncertain
raw_fallback, observed 2026-08-15T16:08:44.499894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:42.848076Z digest=sha256:b41761114acca0655763d2ff111d3a69e433aebe5a19ec84d917e769ae2f33fd

Observation d791954a-b009-47fe-b3ee-636efe0335d6 · outbound

This paper cites Catalog Price Rule.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Catalog Price Rule

Reference 361

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:08:44.338624Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:42.904325Z digest=sha256:1203a25e8e6c213c78b6e7a2b56d89726185b2bd5f052898fd591ec2b16bef58

Observation 3b9a8633-9adb-482a-97a8-879cc7197443 · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 2018

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:08:46.790252Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T16:08:40.613077Z digest=sha256:5f52b3fba7bfdda60c41e90188df481baf86b6aa4b7110e1d522ef9de3324cc8

Observation 78edf6f1-8561-4f74-ba85-cf6c5240871c · outbound

This paper cites an unresolved cited work.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning Unresolved cited work

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:38.785318Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:38.785318Z digest=sha256:294fddc4e91a6bbd2f0f486a96cc75894624f93c3332d1096581dd0cfa305d83

Pith citing papers

Observation 02f62de8-51c4-4717-824a-9f454d01bcf1 · inbound

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents cites this paper.

DeepTravel: An End-to-End Agentic Reinforcement Learning Framework for Autonomous Travel Planning Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T15:49:16.072327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T15:49:16.072327Z digest=sha256:cbb1e0791697fbbd939c2d4d66730fd60124b3b011af696586643e197e510a07

Observation ab033493-353e-4c3c-86e5-a01590349bc5 · inbound

From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails cites this paper.

From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 64

Resolution
verified exact
arxiv_id, observed 2026-05-21T20:44:22.032163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-21T20:42:40.823721Z digest=sha256:e1b81f3ddde4731242cdd121b3e084329c3d90f6896216bbc70b87157cfbd296

Observation 1bac4949-4614-4099-84cb-bf272862a396 · inbound

Graph-Enhanced Policy Optimization in LLM Agent Training cites this paper.

Graph-Enhanced Policy Optimization in LLM Agent Training AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T07:17:44.662944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T07:17:44.662944Z digest=sha256:a3d54a72336ab2f82236a706f378ea5351e58c533b88a5c8c4faa813bd5d9552

Observation 65ecc095-b3c4-4c04-8fd5-45bd71d0c2f1 · inbound

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning cites this paper.

No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T16:03:04.350165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-16T16:01:48.789986Z digest=sha256:1416030c3e8b486bc51e3dc4847788c3c34a3ea4583d6920cd00030fb2960606

Observation 521c8bd2-31d2-4ddf-bc5f-0bfa840077e2 · inbound

SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents cites this paper.

SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-02T23:41:44.971735Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T23:41:44.971735Z digest=sha256:8f40c476dea0ea0cf31c252fae068810bfe7b1273c14837c9b2e890dca2705ef

Observation 62076d23-5f87-47e3-b40e-a118ffdc1d62 · inbound

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents cites this paper.

HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 56

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T18:36:28.302124Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-15T18:35:45.900606Z digest=sha256:82e7a03eaa8f8006504249bc65466214123ef59db37ee5895b10c3c770006338

Observation 80e94209-9660-4f03-9d68-3a17f887eee7 · inbound

Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures cites this paper.

Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 99

Resolution
verified exact
arxiv_id, observed 2026-05-11T11:51:04.003863Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-10T04:31:28.242097Z digest=sha256:9fb30f335977f7d5bcabb856781399e2f18618a855863fefc892b3d734a8890f

Observation a0a00fb7-0848-4b85-af89-ff144e01af2a · inbound

Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game cites this paper.

Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 35

Resolution
verified exact
arxiv_id, observed 2026-05-11T13:16:10.668460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-10T02:03:01.533652Z digest=sha256:4a267b71689fad5f2b41c24b570980a5b2b131a8c9e81844dddffeb962fb72d8

Observation 3f2fe3ee-5043-4fd1-86a5-ce7f9e1e0052 · inbound

Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents cites this paper.

Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-10T00:24:47.266164Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-10T00:07:50.798934Z digest=sha256:fee483f28d56c17e925fe465034c552a2f98fa14eaf55d8bd5ae89bffb392822

Observation d56ae31f-1127-4d63-8d06-b6f79feefa8a · inbound

On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length cites this paper.

On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 38

Resolution
metadata mismatch
arxiv_id, observed 2026-05-09T06:40:40.777758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-08T18:13:25.735085Z digest=sha256:0359dea095b1fad29178b57ed7cc0be5129d8197023e68e8da9b1f2b65262400

Observation 62f24da8-3e94-423f-9baa-ad1e2f5b43ee · inbound

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction cites this paper.

StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 13

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T20:11:12.218032Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-08T09:59:48.604813Z digest=sha256:1cbb9ec509f9376a2cb070a558af9de73433ee62ec9af477a2e2cfac856c5548

Observation 1e85163d-8550-442e-9751-e64bd6830b91 · inbound

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents cites this paper.

Weblica: Scalable and Reproducible Training Environments for Visual Web Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-11T04:25:56.957645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-11T01:25:44.578007Z digest=sha256:fc0bd2310bc9ca42128df977906e60eff6b6f4e685285452ecfb6b4e78b5ef61

Observation 8088afa4-dd0d-4fa3-8c33-a1292a4c46b5 · inbound

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems cites this paper.

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:06:27.547132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-12T01:19:49.062330Z digest=sha256:280d86f10eaa9c832033a1478263b87d130d235b75d700ae4242244641cab758

Observation a6a7d221-1648-47b6-aefe-2964ec339729 · inbound

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems cites this paper.

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-15T05:25:03.885299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-15T05:24:54.265411Z digest=sha256:aaa128a44c984ebf86c606c3640b6c92dce4ebc07acae239439ab24a25e6431c

Observation f9d5f345-c44a-4e88-8985-0fe8803df340 · inbound

GRAFT: Graph-Tokenized LLMs for Tool Planning cites this paper.

GRAFT: Graph-Tokenized LLMs for Tool Planning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-13T07:22:28.269254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-13T07:22:03.560420Z digest=sha256:18df016cf3ba16320809a251037e66bea0bc94630cf68cb035067ae88ed5c299

Observation d857d5c2-67c7-46cb-a55c-bc15d944de6b · inbound

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control cites this paper.

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 43

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T07:32:28.836944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-13T07:30:41.399083Z digest=sha256:39c91f79978d4f75c0fa61d1a948727cab6a03ac7ff59f4fba1c9691853175c5

Observation 199a2e9b-eb9a-4a3a-940b-4e6a27353c78 · inbound

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control cites this paper.

Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 84

Resolution
verified exact
arxiv_id, observed 2026-05-15T06:05:05.669079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-15T06:04:32.640299Z digest=sha256:0586b1ce80205cede09ff26c0b98536d1d653d241c7dbd37e282c34eaa075f89

Observation 72827b3b-f976-4a54-9e0e-970c19d50e4d · inbound

PriorZero: Bridging Language Priors and World Models for Decision Making cites this paper.

PriorZero: Bridging Language Priors and World Models for Decision Making AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 26

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T05:27:18.624132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-13T05:25:05.907123Z digest=sha256:528f286c885f85d45f8e257b85d946de74650c8194e03c604fcd9b4353be19c6

Observation 468889c8-af3e-4213-baa3-d9b4c468334a · inbound

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy cites this paper.

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-15T01:48:28.618421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-15T01:46:24.724553Z digest=sha256:8c9bb762c4098cbb72d65555d02b1a987d78e045a7ad0d19201bbbd26de61748

Observation e1ac94f0-db25-4541-9ebc-593bb43dfd4e · inbound

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning cites this paper.

ICRL: Learning to Internalize Self-Critique with Reinforcement Learning AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 35

Resolution
metadata mismatch
arxiv_id, observed 2026-05-19T18:02:42.395542Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-19T17:58:05.817581Z digest=sha256:40ef22c5910c22ab7ac25c65f8c5f019a3f115f77a20c4a43815484177f0d5ed

Observation b59c1e80-b311-4087-a119-9dbbe090a57a · inbound

Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents cites this paper.

Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-20T05:38:05.470067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-20T05:35:45.084011Z digest=sha256:d21c14e62f37b25dd6b0fce7c42e410bf103c8c9a05d29c20b5ba259267613b3

Observation 8d583fbf-e3c7-403d-b117-3b59177e3305 · inbound

SkillGrad: Optimizing Agent Skills Like Gradient Descent cites this paper.

SkillGrad: Optimizing Agent Skills Like Gradient Descent AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 1

Resolution
malformed identifier
arxiv_id, observed 2026-06-29T16:53:41.304135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-29T16:46:09.930635Z digest=sha256:0f70cdc692d3a4017f157772feade8d799443edb7d1a04fe83b0c6af20e54a62

Observation 6b1e739c-bb86-4664-9402-992f048bad50 · inbound

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories cites this paper.

Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-07-14T10:33:54.851493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T10:33:54.851493Z digest=sha256:f2c26393d9d2c7a1964751894fadf29b48432d70cd25e68c95466ef099b1b06f

Observation 763e6f28-3062-4056-96fa-b9052d9b42fb · inbound

From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training cites this paper.

From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-02T09:45:49.609534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T09:45:49.609534Z digest=sha256:2b2a03f47a310d978c26aaa714f39a299383e7369e54f4f4896a6caa35c3ab2d

Observation 1a45e017-0649-429c-b45c-3054a1e94154 · inbound

From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation cites this paper.

From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T08:56:35.257327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T08:56:35.257327Z digest=sha256:2f3fc17af6fa58542a76d33c7f4ea588b3e9d9543b45bcb550a802a59d281417

Observation 1934517f-cac9-4a64-9ac3-74851e6dce68 · inbound

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play cites this paper.

When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-01T12:36:12.420962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T12:36:12.420962Z digest=sha256:6496a369235c338d466b0841e2a65172c19cea6f7467a39cb5829c5fb6382f0b

Observation 4e2c48f9-e951-48b3-8d4a-71238d638059 · inbound

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution cites this paper.

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-30T21:12:59.428554Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T21:12:59.428554Z digest=sha256:a0c0ed87d926d86d26f8975edbebc94c06e52d4e91b96219f80441d6642c89c1