Pith. sign in

Paper Citation Record · LEDGER

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

As of 17 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 11 inbound Pith citation observations for arXiv:2508.18669.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.18669 v1

Coverage vector

measured 47 of 47 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T16:22:51.681755Z

measured 58 of 58 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:15:04.627801Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-08T15:35:07.151222Z

Reference resolution

47 of 47 outbound references displayed

  • verified exact0
  • verified fuzzy11
  • unresolved36
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cd035e9a-a855-4838-9a5a-097e5365af56 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Kimi K2: Open Agentic Intelligence

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.495039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.495039Z digest=sha256:8a7ddb2a4f1f1d4b7ea7e9b048c5bb63e8c339f13be1d98d54b660b7bb898f44

Observation 05603cab-74cd-4ddd-a45a-4f6d17706760 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.499436Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.499436Z digest=sha256:630843e9276555d6c64e9d64e8f37fc230e16070e4b0df51e4bc8baebd697ab7

Observation a0fb646b-3a1e-45cb-adb4-6f1ff32937aa · outbound

This paper cites ReTool: Reinforcement Learning for Strategic Tool Use in LLMs.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ReTool: Reinforcement Learning for Strategic Tool Use in LLMs

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.503088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.503088Z digest=sha256:98854b84b5c186a9e3b0e99a9935b46c88bb24da10a002a9b6d72e3699d5a64c

Observation 8fe26866-1bab-4b30-bb80-e618129c16b4 · outbound

This paper cites Gonzalez, and Ion Stoica.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Gonzalez, and Ion Stoica

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.507334Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.507334Z digest=sha256:f69bc333f66c1755e403c58e6fbb0ed8b6889e3a4ee34ffbb2bcb5e5c3229f98

Observation 20ea23a1-92a8-4a08-8f9b-c2c8a16bfe37 · outbound

This paper cites RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.511495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.511495Z digest=sha256:946bc47ad131c01eb108f36a1c7b4c6abdc3c2c62491e839c1eb71024e11a889

Observation 3e7b5f80-c70a-47ab-acb1-122be6293cfe · outbound

This paper cites Proximal Policy Optimization Algorithms.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Proximal Policy Optimization Algorithms

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.516645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.516645Z digest=sha256:20e305ef1509a34daeb89eab9fad5c1a3604eb4239663520492c0e2c42bbddbd

Observation a1dd30f9-0879-46db-82d8-0df364935d88 · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.378133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.521563Z digest=sha256:b19d66c6041023d7f880f6980f81ef3e77c0231f210fe8378b9ea3b851d4aa54

Observation 631af179-9c0a-4ff3-8b35-4918fdcf5670 · outbound

This paper cites Buy 4 reinforce samples, get a baseline for free! Learn- ing,Learning, Mar 2019.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Buy 4 reinforce samples, get a baseline for free! Learn- ing,Learning, Mar 2019

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.367337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.525173Z digest=sha256:08fb4b9a6142ac6210bf779369eae9e56fb2362efcec1cba69de1a80e1bb842f

Observation 724f0b98-6405-4417-b4f9-e4fd58dc0f24 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.529177Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.529177Z digest=sha256:194580d9a67eaac78a6078c758319a5c306ca9419e12f5f62addc2a5a10d5e36

Observation e26e9302-4be4-4c86-8859-9b443d212786 · outbound

This paper cites Star: Bootstrapping reasoning with reasoning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Star: Bootstrapping reasoning with reasoning

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.356089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.532984Z digest=sha256:2f3d941fa4363317134e2473eb0f783c9960ed8cef2b9a044fb2b2e899305f54

Observation 0e42f05a-7af7-4101-b757-a994d78ff299 · outbound

This paper cites Reasoning with Language Model is Planning with World Model.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Reasoning with Language Model is Planning with World Model

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.536655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.536655Z digest=sha256:dcfc9b20d9946adfa9f285047574af581da52c33c9120a0fe72e4b5c5a8bf303

Observation 8eceef6f-2047-4f61-82d9-b510836faff8 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.541461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.541461Z digest=sha256:5be0f3f3af2256adc9ee51d79d836945a1dc9576aac34b76d0c63e0e2301de74

Observation a0bc6eb0-5b3c-41a5-bc9e-111085d807b4 · outbound

This paper cites Code-r1: Reproducing r1 for code with reliable rewards.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Code-r1: Reproducing r1 for code with reliable rewards

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.545595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.545595Z digest=sha256:afaf969d32286c39566b3dd8b533fe6fac485595416ad5a0ec0d8615c1d0391c

Observation 57ac40bf-5d47-480f-9deb-01ad51d2eccb · outbound

This paper cites VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.550260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.550260Z digest=sha256:e79a9bacc334e07a3de453d83cb882c87fc200f92ee6d3f32550f74ab427c1f6

Observation ea85cc3e-a2a6-40ac-a17d-32a8c242341c · outbound

This paper cites Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.555224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.555224Z digest=sha256:ce65bcbc49b723a8d1543c7df648b330087b8c66d0274d9d624e4cfa59ae3ffc

Observation cb121056-e228-4f72-9957-c62926009f79 · outbound

This paper cites Instructerc: Reforming emotion recognition in conversation with a retrieval multi-task llms framework.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Instructerc: Reforming emotion recognition in conversation with a retrieval multi-task llms framework

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.345922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.560011Z digest=sha256:6482010d8e0e96a729464907ef55cce866ebb545c6b45e127c393819324afa07

Observation 955b1022-2129-4f30-99d0-34d7346f240c · outbound

This paper cites Hammer: Robust function-calling for on-device language models via function masking.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Hammer: Robust function-calling for on-device language models via function masking

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.563585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.563585Z digest=sha256:6b2bdd30227806130d10041b911edde72f2008ff36e0c66d287cf281a3558379

Observation 1ee74172-ff78-4f40-9175-cbb1a1b76af0 · outbound

This paper cites xlam: A family of large action models to empower ai agent systems.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use xlam: A family of large action models to empower ai agent systems

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.334954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.568240Z digest=sha256:ddf3b190168b4cdc372c4031b523077319b5b051a3889641df0d0f8eb5571391

Observation 3d4b5ff1-95d3-4335-9607-07b90c82f338 · outbound

This paper cites Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.571925Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.571925Z digest=sha256:02ffc1d3923f4329525ad7e67c76c3bfdc9e2f246449e0b07bb2259eee880231

Observation 115a9a25-065f-4794-89d2-efa50f9e47bf · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.575951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.575951Z digest=sha256:9f7a2337a71e6002f8d3ad2c256a44f0250745ce18b8e05f8c3f5217784bcdd8

Observation 4aa972d9-522e-40aa-9b7d-71a8afa19c0e · outbound

This paper cites ZeroSearch: Incentivize the Search Capability of LLMs without Searching.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ZeroSearch: Incentivize the Search Capability of LLMs without Searching

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.580729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.580729Z digest=sha256:03b797ff69fc857bd9e1e7113a2a9e27e9c4c9b85ca0b700673172267c7cb179

Observation a7d18c52-045b-4390-a996-eb97c0cad2ef · outbound

This paper cites ToRL: Scaling Tool-Integrated RL.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ToRL: Scaling Tool-Integrated RL

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.584383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.584383Z digest=sha256:cceabda8d23522f2daf833534367ab7cd71258bb330e3615d324244c0f355152

Observation e52003de-437d-4409-ae87-f10b1522336c · outbound

This paper cites Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.588510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.588510Z digest=sha256:0e4162bd01ba98bf77f4e1eb59e6317fe1c57b9bcf9a6b3cac2adcdce257d3a7

Observation 6028b4a8-4a88-4342-a4a3-59af3a053aaa · outbound

This paper cites AgentInstruct: Toward Generative Teaching with Agentic Flows.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use AgentInstruct: Toward Generative Teaching with Agentic Flows

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.591964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.591964Z digest=sha256:2f9df1941d16123c9914f8dceff0789872bcf82226ce67b1c5fd0f73fc6d7814

Observation a3d7c793-3654-490f-927a-e3eda35011e3 · outbound

This paper cites StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.595736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.595736Z digest=sha256:5b9357d595202e8b86c4aa2ca132289109dab957047658781bb1cff7f6bc4857

Observation 116e2fdc-2134-4e72-b837-be93e9df192a · outbound

This paper cites Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.599569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.599569Z digest=sha256:a04ee601dcdfedf6b80988ec3405753c85da5de628261247f705aa3f80527816

Observation 3fa98f77-b13e-4083-8f07-8d24fc1c566e · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.603971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.603971Z digest=sha256:30fe80f5f2e3c4256e01b6f3c2a3e94563de6b32473f1ed61e69794441e09217

Observation cd6e296d-3ea8-473e-b4a2-77d08c328fd4 · outbound

This paper cites an unresolved cited work.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.608211Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.608211Z digest=sha256:0b9947319b278860d8b4d619f6ee748c7ec2570c493309a14e1516df66ecb792

Observation 84ac58dc-b084-4e81-822e-dab037fe247c · outbound

This paper cites ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.611803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.611803Z digest=sha256:d879ccebb498f115f3848a34815b3f61cbe8076d7b15b7b1d3ceb5ff4c3974b5

Observation 2a752a56-5318-43b5-8de1-6689bd32a4e0 · outbound

This paper cites WebThinker: Empowering Large Reasoning Models with Deep Research Capability.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use WebThinker: Empowering Large Reasoning Models with Deep Research Capability

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.615983Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.615983Z digest=sha256:ad47a211017947b7af27a77edd77d1e0caaf4aa330c01e3ddedce8dc890a0e2a

Observation 16a9385a-cff2-4ccf-b27f-660bae9b7ddb · outbound

This paper cites Plm-based world models for text-based games.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Plm-based world models for text-based games

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.323994Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.620068Z digest=sha256:ce4725f46a0e7af2b85e1cb90fd3f2fd26640d8f925ad1e0190419f60b89286d

Observation d255c769-1a32-4ece-a74a-6ca7d801855c · outbound

This paper cites Generative agents: Interactive simulacra of human behavior.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Generative agents: Interactive simulacra of human behavior

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.312333Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.623606Z digest=sha256:943d5a26b33aaf6381649bfcf864367b1d8f2844d5b5e1856bb34c2e7f9cedf9

Observation 07ad9f53-0fc0-4992-8509-da22c3a4d494 · outbound

This paper cites ToolRL: Reward is All Tool Learning Needs.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use ToolRL: Reward is All Tool Learning Needs

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.627300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.627300Z digest=sha256:08d847d47410b93053029aa9b917712ca5e7a47f2f217c12fbaf0b2a13f42d7f

Observation 159b4990-e5c7-4400-b315-9e5dbff73feb · outbound

This paper cites Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.631063Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.631063Z digest=sha256:cf6c0f104b715ef8217d9eee68e5ce5e663808415c2da620cfb9f230c7682dda

Observation ed009504-4a98-4e4c-bb84-d7d1fe05d32d · outbound

This paper cites Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.301977Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.634893Z digest=sha256:7a505960810b558ca8225786a933527e7320bb5f20e2484d8f19a0ed6a4c1566

Observation 28acd782-d161-40c5-9e51-5a45b0b240a9 · outbound

This paper cites Qwen3 Technical Report.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Qwen3 Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.638697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.638697Z digest=sha256:8fb375086856486a8fb7c9b9d6375c4abea9b71a09dc9e42ed8d943e513b4587

Observation 29c0c48d-3474-413f-bc63-c3baff453695 · outbound

This paper cites Decoupled Weight Decay Regularization.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Decoupled Weight Decay Regularization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.642783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.642783Z digest=sha256:3fe0084f83f1c30b7f8a8d0cc4b1e24e2efec6ab352ece80235d44570779b271

Observation 99c154c9-34e3-4a41-9e52-733796921874 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use HybridFlow: A Flexible and Efficient RLHF Framework

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.646536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.646536Z digest=sha256:b5bb5e0aad6eca08a844f837b42612d0c4c1c314d914734876171e0223b8f18b

Observation c329e446-20e4-4e70-a34b-45e5ac0a92eb · outbound

This paper cites $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use $\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.650372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.650372Z digest=sha256:d9e6c6094fd13e7a57579c83e6e9f0d8bb6c27d33671b0ffec3dcdfe254b9b0e

Observation 86f669ba-ffd7-4308-b669-38a751da45e4 · outbound

This paper cites GPT-4o System Card.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use GPT-4o System Card

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.654164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.654164Z digest=sha256:eaa9938ab3bc9b5e8b94ab74687a1d70b5b0aad3e9057af4c45336f0acb69211

Observation 260d555d-7799-4ba3-93ef-e9f0e6d4d55d · outbound

This paper cites $\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use $\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.657952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.657952Z digest=sha256:601b280c27208b17a82820c9ac5950aa8d7c20344e4d4b73b1763c0b2f12340d

Observation 89b5a9ae-d96d-434f-aaf2-dc4ff909cb15 · outbound

This paper cites The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.291068Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.662318Z digest=sha256:79a2e24f0186ae0fc24d5eb304cdb838a58f83f949cd5e39a6ad8479991fc8b8

Observation b4a34744-4040-472f-a8f5-24a6df2c4a35 · outbound

This paper cites Acebench: Who wins the match point in tool usage? arXiv preprint arXiv:2501.12851, 2025.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use Acebench: Who wins the match point in tool usage? arXiv preprint arXiv:2501.12851, 2025

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.665618Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.665618Z digest=sha256:9f5fe5663a10da0f3fbe1dd6b09af9fdec66e0f7cd3de6edba483fc6a667f3af

Observation d533bfd7-f531-4160-bdf8-d683f7845a16 · outbound

This paper cites DeepSeek-V3 Technical Report.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use DeepSeek-V3 Technical Report

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.669555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.669555Z digest=sha256:65f1b06ad55ed21a5871f0e8d2775903a19281b1f8c7e5f131a8c291e747d433

Observation 14f7e64c-b556-46ef-bbd3-11a642a4470e · outbound

This paper cites GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T16:22:51.673650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:22:51.673650Z digest=sha256:0574c5a59d889b921aa51c98fe570bce211baa60e558b4c8ea546e0037350f8e

Observation 7cb328aa-1ec2-4dc1-84cd-094d76a1f226 · outbound

This paper cites term":"Sakura.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use term":"Sakura

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.279618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.677850Z digest=sha256:cb29c0ec197c9ac1d712a8c6d675b8a09e4fd2ed051699835a96f11244cb4196

Observation 9b796e61-8568-4fab-b7ea-ccc1bd211a66 · outbound

This paper cites 02:30:00.

MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use 02:30:00

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T16:22:52.268550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T16:22:51.681755Z digest=sha256:7d16bf54f1cef5c3d4eee047ac6095f52029d154fcd1d4f1eb3734dca95616db

Pith citing papers

Observation 6d4fd521-4b00-4928-b9ea-5952643f3ce4 · inbound

Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory cites this paper.

Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-03T18:03:39.498611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T18:03:39.498611Z digest=sha256:d384f7f47f8aea031d693f79efed82f81026f8263a0920a32694d73bafc21374

Observation f10900cb-86fe-4da9-8034-b54a86907c95 · inbound

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence cites this paper.

Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 134

Resolution
verified exact
arxiv_id, observed 2026-05-10T05:25:54.646467Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-10T05:24:00.503836Z digest=sha256:50c705c3ffa3e5b6d91a996a436699bf5e17aba9db36a7c62c6c5eeeb0400f17

Observation ee64902f-ac2d-4f45-bee9-a041bc1bbb7f · inbound

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning cites this paper.

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 181

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:15:49.418878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-05-10T19:15:27.406778Z digest=sha256:f601e19d80cc0bb67ad57bd883c6a7bc71793ac437edf703837351955c8fa15c

Observation a31372e8-1eb0-4ce9-b5fa-7c954d5b0eb0 · inbound

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators cites this paper.

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:41:24.084915Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-12T00:51:57.796883Z digest=sha256:cf852f8d16b85dd211742b42da83726f6f122a676c206f166e9e1676a638b6b2

Observation 3bf48290-6246-46b3-98c8-504dd83bb253 · inbound

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators cites this paper.

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-02T14:37:24.484309Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T14:37:24.484309Z digest=sha256:c30a41d0f43ae7887041e320d4f564be7d0a04ac374e8cd83f40c5e91db88f74

Observation 4812cde0-8357-4799-be70-1e70dcc89e76 · inbound

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents cites this paper.

When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:52:22.056914Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-13T05:51:18.680969Z digest=sha256:61f9753c928b056db72251a660f2262fe0a24073ba574969d727e590877120ee

Observation 633cafca-e809-453b-a331-369110412474 · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 141

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:46:14.307374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:398e8b03fa30e76f3b4757de82bf48f815c78571ddfd2248efc16cd4ef45cd73

Observation 72b083e3-7392-4955-898f-74a650db6a31 · inbound

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments cites this paper.

Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 27

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T03:36:29.692587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-06-28T09:54:00.111238Z digest=sha256:8db79311b0d62ea35b27f3809009dd87ae84d1129f8bfe57a9aa1889bca2e69b

Observation 73dd061a-8945-445a-86b7-ba01e5e90857 · inbound

CurateEvo: Data-Curation Evolving for Agentic Post-Training cites this paper.

CurateEvo: Data-Curation Evolving for Agentic Post-Training MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 42

Resolution
metadata mismatch
local_arxiv, observed 2026-07-08T15:35:07.152620Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-07-08T15:33:01.138366Z digest=sha256:3a20846514f8f12aa9b34d253363f8046a253fa3aca021a859ca46312053e24a

Observation b1bb2712-7032-43aa-84fb-fa6502ce6bdc · inbound

AgentOmnia: Scaling Agentic Models for Full-Scenario Applications cites this paper.

AgentOmnia: Scaling Agentic Models for Full-Scenario Applications MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-01T03:38:19.076593Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:38:19.076593Z digest=sha256:ca348c7991da5b6243e8b8456dc301cb7f40edc778b5a385739e15f3a2359fa3

Observation d46331dc-b1ae-4f63-97d0-e5f686348cc2 · inbound

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL cites this paper.

One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-16T00:15:04.627801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:15:04.627801Z digest=sha256:45b478258035befef179a2c94f2d79b8be30e12ea180f4f935419bcf1bd4c3d4