{"as_of":"2026-08-10T11:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca5bdd6e84a05bda55c89b398bd2ce3e7dd7f56803d024cf719a23cc66fb0bff","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:22:51.681755Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:03:39.498611Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T15:35:07.151222Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-08-03T18:03:39.498611Z","title":"Memengine: A unified and modular library for develop- ing advanced memory of llm-based agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.07287","last_updated":"2026-06-28T11:58:42Z","snapshot_observed_at":"2026-08-05T13:20:26.960914Z","submitted_at":"2025-12-08T08:27:24Z","title":"Experience-Evolving Multi-Turn Tool-Use Agent with Hybrid Episodic-Procedural Memory","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:03:39.498611Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2512.07287"},"observation_digest":"sha256:776bdf2aa33a2bd3b56e1de5806b7df236d5a91c731d6fb00cc9478d08c0376c","observation_id":"6d4fd521-4b00-4928-b9ea-5952643f3ce4","resolution":{"observed_at":"2026-08-03T18:03:39.498611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":"2508.18669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-07-08T15:35:07.151222Z","title":"Mua-rl: Multi-turn user-interacting agent reinforcement learning for agentic tool use","venue":"cs.AI","work_id":"c07f770d-7f30-4bf0-9690-dad799d0d79d","year":2025},"citing_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:00.503836Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2604.18292"},"observation_digest":"sha256:d700510597b7716cdd8dd78d120417935f9fb21d0d77119988b18602c2f4d844","observation_id":"f10900cb-86fe-4da9-8034-b54a86907c95","resolution":{"observed_at":"2026-05-10T05:25:54.646467Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":"2508.18669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-07-08T15:35:07.151222Z","title":"Mua-rl: Multi-turn user-interacting agent reinforcement learning for agentic tool use","venue":"cs.AI","work_id":"c07f770d-7f30-4bf0-9690-dad799d0d79d","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":181,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:5a1185b5f04efe96d91cb629264f45903966e067f332721b9fba81a6d8b4f55c","observation_id":"ee64902f-ac2d-4f45-bee9-a041bc1bbb7f","resolution":{"observed_at":"2026-05-10T23:15:49.418878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":"2508.18669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-07-08T15:35:07.151222Z","title":"Mua-rl: Multi-turn user-interacting agent reinforcement learning for agentic tool use","venue":"cs.AI","work_id":"c07f770d-7f30-4bf0-9690-dad799d0d79d","year":2025},"citing_paper":{"arxiv_id":"2605.08334","last_updated":"2026-07-29T00:50:03Z","snapshot_observed_at":"2026-08-02T18:36:13.233377Z","submitted_at":"2026-05-08T17:59:23Z","title":"CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:57.796883Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2605.08334"},"observation_digest":"sha256:6d2cc35933254b5008113a276572c7cb818826478100ed37133427851c54a16d","observation_id":"a31372e8-1eb0-4ce9-b5fa-7c954d5b0eb0","resolution":{"observed_at":"2026-05-12T08:41:24.084915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-08-02T14:37:24.484309Z","title":"Mua-rl: Multi-turn user-interacting agent reinforcement learning for agentic tool use.arXiv preprint arXiv:2508.18669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.08334","last_updated":"2026-07-29T00:50:03Z","snapshot_observed_at":"2026-08-02T18:36:13.233377Z","submitted_at":"2026-05-08T17:59:23Z","title":"CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T14:37:24.484309Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2605.08334"},"observation_digest":"sha256:75788b56ea48b569275682af4506f080082eec58c12e5721369aa111bb94efff","observation_id":"3bf48290-6246-46b3-98c8-504dd83bb253","resolution":{"observed_at":"2026-08-02T14:37:24.484309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":"2508.18669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-07-08T15:35:07.151222Z","title":"Mua-rl: Multi-turn user-interacting agent reinforcement learning for agentic tool use","venue":"cs.AI","work_id":"c07f770d-7f30-4bf0-9690-dad799d0d79d","year":2025},"citing_paper":{"arxiv_id":"2605.11928","last_updated":"2026-05-12T10:40:28Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T10:40:28Z","title":"When Simulation Lies: A Sim-to-Real Benchmark and Domain-Randomized RL Recipe for Tool-Use Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T05:51:18.680969Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2605.11928"},"observation_digest":"sha256:740d51ab8cb4c0f26224a38626d601f9e1222f66c31aa1aa71be17c4ad4ab709","observation_id":"4812cde0-8357-4799-be70-1e70dcc89e76","resolution":{"observed_at":"2026-05-13T05:52:22.056914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":"2508.18669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-07-08T15:35:07.151222Z","title":"Mua-rl: Multi-turn user-interacting agent reinforcement learning for agentic tool use","venue":"cs.AI","work_id":"c07f770d-7f30-4bf0-9690-dad799d0d79d","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:c9a1bba880eeb188ec2159fe59cd455c5378c1861070b820d3979804a6aac845","observation_id":"633cafca-e809-453b-a331-369110412474","resolution":{"observed_at":"2026-07-01T20:46:14.307374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":"2508.18669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-07-08T15:35:07.151222Z","title":"Mua-rl: Multi-turn user-interacting agent reinforcement learning for agentic tool use","venue":"cs.AI","work_id":"c07f770d-7f30-4bf0-9690-dad799d0d79d","year":2025},"citing_paper":{"arxiv_id":"2606.03892","last_updated":"2026-06-03T17:27:54Z","snapshot_observed_at":"2026-08-02T03:27:20.684742Z","submitted_at":"2026-06-02T16:52:31Z","title":"Synthesize and Reward -- Reinforcement Learning for Multi-Step Tool Use in Live Environments","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T09:54:00.111238Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2606.03892"},"observation_digest":"sha256:4636d1c975b7e9dc289b2e6344dbc71517676774d404f51bed06602b2940ba85","observation_id":"72b083e3-7392-4955-898f-74a650db6a31","resolution":{"observed_at":"2026-07-02T03:36:29.692587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":"2508.18669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-07-08T15:35:07.151222Z","title":"Mua-rl: Multi-turn user-interacting agent reinforcement learning for agentic tool use","venue":"cs.AI","work_id":"c07f770d-7f30-4bf0-9690-dad799d0d79d","year":2025},"citing_paper":{"arxiv_id":"2607.06140","last_updated":"2026-07-07T11:07:00Z","snapshot_observed_at":"2026-07-10T23:17:34.345638Z","submitted_at":"2026-07-07T11:07:00Z","title":"CurateEvo: Data-Curation Evolving for Agentic Post-Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-08T15:33:01.138366Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2607.06140"},"observation_digest":"sha256:66f1ab3d71c8036b0405b7fb40e5d8a8b6ed41cb66b187e807cf8af53ea8bc2e","observation_id":"73dd061a-8945-445a-86b7-ba01e5e90857","resolution":{"observed_at":"2026-07-08T15:35:07.152620Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18669","snapshot_observed_at":"2026-08-01T03:38:19.076593Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23124","last_updated":"2026-07-25T09:58:24Z","snapshot_observed_at":"2026-08-06T19:50:20.416891Z","submitted_at":"2026-07-25T09:58:24Z","title":"AgentOmnia: Scaling Agentic Models for Full-Scenario Applications","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T03:38:19.076593Z"},"links":{"cited_paper":"/paper/2508.18669","citing_paper":"/paper/2607.23124"},"observation_digest":"sha256:b8e316329173e566292c1a8425af642c7783f4c4c1c9817ea1a92384ce1cab8d","observation_id":"b1bb2712-7032-43aa-84fb-fa6502ce6bdc","resolution":{"observed_at":"2026-08-01T03:38:19.076593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.18669/citation-record","integrity":"/paper/2508.18669/integrity","json":"/paper/2508.18669/citation-record.json","paper":"/paper/2508.18669"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T16:22:51.495039Z","title":"Kimi k2: Open agentic intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.495039Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:d5fda9638d3485ea8fbd3b2535cdbeafaa3da18ba6cf4171d800e03d7cfe3bc4","observation_id":"cd035e9a-a855-4838-9a5a-097e5365af56","resolution":{"observed_at":"2026-08-05T16:22:51.495039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T16:22:51.499436Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.499436Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:7dc7f9b36a02ea2e037df01f370640639a46470b211788d0c599df39b207bb57","observation_id":"05603cab-74cd-4ddd-a45a-4f6d17706760","resolution":{"observed_at":"2026-08-05T16:22:51.499436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11536","snapshot_observed_at":"2026-08-05T16:22:51.503088Z","title":"Retool: Reinforcement learning for strategic tool use in llms.arXiv preprint arXiv:2504.11536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.503088Z"},"links":{"cited_paper":"/paper/2504.11536","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:0ec19e118cdb472169bce210d455118fd9e16af89880d3bb9c6a547289a69a27","observation_id":"a0fb646b-3a1e-45cb-adb4-6f1ff32937aa","resolution":{"observed_at":"2026-08-05T16:22:51.503088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:51.507334Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.507334Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:2309a9e0f54d346d277640dc2544881f9c43318af588edf98ac1b485533f07f5","observation_id":"8fe26866-1bab-4b30-bb80-e618129c16b4","resolution":{"observed_at":"2026-08-05T16:22:51.507334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-10T06:52:44.809057Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T16:22:51.511495Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.511495Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:55e321e38afedfb1b02ce3c3167b1bc357ac5cb8747ef20800da379102588d29","observation_id":"20ea23a1-92a8-4a08-8f9b-c2c8a16bfe37","resolution":{"observed_at":"2026-08-05T16:22:51.511495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T16:22:51.516645Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.516645Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:559bbf11eb413fe71b06aaa519d63dc42e845840eadc7c5c07ecf3c0d2566cfc","observation_id":"3e7b5f80-c70a-47ab-acb1-122be6293cfe","resolution":{"observed_at":"2026-08-05T16:22:51.516645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.374261Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"1a66a245-6897-4686-b3df-d9008c31dc17","year":2018},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.521563Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:ce63f594913460e60f805adbd8009439d01fe93948ea39e440a231845531f9b4","observation_id":"a1dd30f9-0879-46db-82d8-0df364935d88","resolution":{"observed_at":"2026-08-05T16:22:52.378133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.363559Z","title":"Buy 4 reinforce samples, get a baseline for free! Learn- ing,Learning, Mar 2019","venue":null,"work_id":"55b1c554-30e2-4a7e-aa1b-c4a2d9b4a1fa","year":2019},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.525173Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:1bc8f5a95338b1dd2100576bdc333adcd7e778d08a92ecb2d0b78c5967e4e176","observation_id":"631af179-9c0a-4ff3-8b35-4918fdcf5670","resolution":{"observed_at":"2026-08-05T16:22:52.367337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T16:22:51.529177Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.529177Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:764f90838181cbd2afc45b43949d117862aa5a438c2fa9eab12c28abd524011d","observation_id":"724f0b98-6405-4417-b4f9-e4fd58dc0f24","resolution":{"observed_at":"2026-08-05T16:22:51.529177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.352425Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":"8cee2ba1-c77a-45b1-8a80-cdd678d1bcaf","year":2022},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.532984Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:443fde72e8336078f1c036b2d19e84f73c09d21bc6b5453cde567913a190f937","observation_id":"e26e9302-4be4-4c86-8859-9b443d212786","resolution":{"observed_at":"2026-08-05T16:22:52.356089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-05T16:22:51.536655Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.536655Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:c749820e4c28a730b36fa3dc798a325389be7483b368eda812583547d40eac6c","observation_id":"0e42f05a-7af7-4101-b757-a994d78ff299","resolution":{"observed_at":"2026-08-05T16:22:51.536655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T16:22:51.541461Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.541461Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:abf5b63689937a6231d911e5732eeb35fde963f254e1f4d1f0b185ccdfb17463","observation_id":"8eceef6f-2047-4f61-82d9-b510836faff8","resolution":{"observed_at":"2026-08-05T16:22:51.541461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:51.545595Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.545595Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:deab5df45180f93eb3f3c91326270dc8b5ad11f0246c59cc0d671baf927cd3a3","observation_id":"a0bc6eb0-5b3c-41a5-bc9e-111085d807b4","resolution":{"observed_at":"2026-08-05T16:22:51.545595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-05T16:22:51.550260Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.550260Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:7336894e0cf30c8de2dd32b07db2bf8c688d57b164c88d0cb5f96403f7827268","observation_id":"57ac40bf-5d47-480f-9deb-01ad51d2eccb","resolution":{"observed_at":"2026-08-05T16:22:51.550260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12588","snapshot_observed_at":"2026-08-05T16:22:51.555224Z","title":"Program of thoughts prompting: Disentangling computation from reasoning for numerical reasoning tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.555224Z"},"links":{"cited_paper":"/paper/2211.12588","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:0ba39deb463060bb60ccad5b56f2c5526c9b49ac53cbb1023cf3dc2a2503c6bd","observation_id":"ea85cc3e-a2a6-40ac-a17d-32a8c242341c","resolution":{"observed_at":"2026-08-05T16:22:51.555224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.341700Z","title":"Instructerc: Reforming emotion recognition in conversation with a retrieval multi-task llms framework","venue":null,"work_id":"1bbf4798-2446-4cc7-9bc6-c36bc6c99904","year":2023},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.560011Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:ba663f8799f73f5313d6c07bb233f2f9da1d273e076f051694dffcbe1d1e3ca7","observation_id":"cb121056-e228-4f72-9957-c62926009f79","resolution":{"observed_at":"2026-08-05T16:22:52.345922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:51.563585Z","title":"Hammer: Robust function-calling for on-device language models via function masking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.563585Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:d66c6ee85f1f7c79a50de758c81221ff8ce70d79a470954c11a8aab59f6495ee","observation_id":"955b1022-2129-4f30-99d0-34d7346f240c","resolution":{"observed_at":"2026-08-05T16:22:51.563585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.331108Z","title":"xlam: A family of large action models to empower ai agent systems","venue":null,"work_id":"bac7d5d8-5666-438e-a54a-d34a8c4be270","year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.568240Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:cc2352171619d8b6e89f5ec2d59ed076abbe75b11266625c7b3cfb3c615fc8db","observation_id":"1ee74172-ff78-4f40-9175-cbb1a1b76af0","resolution":{"observed_at":"2026-08-05T16:22:52.334954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08820","last_updated":"2025-02-19T04:28:49Z","snapshot_observed_at":"2026-08-07T23:32:20.263382Z","submitted_at":"2025-02-12T22:18:34Z","title":"Can a Single Model Master Both Multi-turn Conversations and Tool Use? CoALM: A Unified Conversational Agentic Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08820","snapshot_observed_at":"2026-08-05T16:22:51.571925Z","title":"Can a single model master both multi-turn conversations and tool use? coalm: A unified conversational agentic language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.571925Z"},"links":{"cited_paper":"/paper/2502.08820","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:e9c7505042faf06cf4420ee4184a4f0ce62be92484356813a746aa201dcaec81","observation_id":"3d4b5ff1-95d3-4335-9607-07b90c82f338","resolution":{"observed_at":"2026-08-05T16:22:51.571925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-09T05:07:17.305244Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-05T16:22:51.575951Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.575951Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:d5805d7c954d9c6733f269d92bcae84494d5d98427dfd23756e2d07a6c08b17c","observation_id":"115a9a25-065f-4794-89d2-efa50f9e47bf","resolution":{"observed_at":"2026-08-05T16:22:51.575951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-05T16:22:51.580729Z","title":"Zerosearch: Incentivize the search capability of llms without searching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.580729Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:5c433d3bc94f81f1c7b7f4de088eb98d0b6a3f0227bf0ddc94e12d3591251523","observation_id":"4aa972d9-522e-40aa-9b7d-71a8afa19c0e","resolution":{"observed_at":"2026-08-05T16:22:51.580729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T16:22:51.584383Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.584383Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:995b6457f708ee151afbdfd9c26e8d100f1350a0d83ee29ce11970c7af2e8977","observation_id":"a7d18c52-045b-4390-a996-eb97c0cad2ef","resolution":{"observed_at":"2026-08-05T16:22:51.584383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01441","last_updated":"2025-04-28T10:42:49Z","snapshot_observed_at":"2026-08-05T20:36:54.358831Z","submitted_at":"2025-04-28T10:42:49Z","title":"Agentic Reasoning and Tool Integration for LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01441","snapshot_observed_at":"2026-08-05T16:22:51.588510Z","title":"Agentic reasoning and tool integration for llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.588510Z"},"links":{"cited_paper":"/paper/2505.01441","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:e0db39f6f2cdf54e1c639a31c4be9db97590a151e7f3a2928fc6298021884c52","observation_id":"e52003de-437d-4409-ae87-f10b1522336c","resolution":{"observed_at":"2026-08-05T16:22:51.588510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03502","last_updated":"2024-07-03T21:01:12Z","snapshot_observed_at":"2026-08-07T20:57:52.466823Z","submitted_at":"2024-07-03T21:01:12Z","title":"AgentInstruct: Toward Generative Teaching with Agentic Flows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03502","snapshot_observed_at":"2026-08-05T16:22:51.591964Z","title":"Agentinstruct: Toward generative teaching with agentic flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.591964Z"},"links":{"cited_paper":"/paper/2407.03502","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:27d1b1e51e2706789eb7e9ed0d587c96de8c31c490a0ed2f615ef973bdab58b5","observation_id":"6028b4a8-4a88-4342-a4a3-59af3a053aaa","resolution":{"observed_at":"2026-08-05T16:22:51.591964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07714","last_updated":"2025-03-05T07:39:03Z","snapshot_observed_at":"2026-08-05T00:50:54.678872Z","submitted_at":"2024-03-12T14:57:40Z","title":"StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07714","snapshot_observed_at":"2026-08-05T16:22:51.595736Z","title":"Stabletoolbench: Towards stable large-scale benchmarking on tool learning of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.595736Z"},"links":{"cited_paper":"/paper/2403.07714","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:9cfce5f4a909a58c94bb1bc7dc749d2c007a4030158cf2aad34d53173430566a","observation_id":"a3d7c793-3654-490f-927a-e3eda35011e3","resolution":{"observed_at":"2026-08-05T16:22:51.595736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23278","last_updated":"2025-10-07T07:13:32Z","snapshot_observed_at":"2026-07-06T21:00:55.979837Z","submitted_at":"2025-03-30T01:58:22Z","title":"Model Context Protocol (MCP): Landscape, Security Threats, and Future Research Directions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23278","snapshot_observed_at":"2026-08-05T16:22:51.599569Z","title":"Model context protocol (mcp): Landscape, security threats, and future research directions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.599569Z"},"links":{"cited_paper":"/paper/2503.23278","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:4c23cddefb35efde5c6690aebbb161e50692c184bcb9b77819eb48e742a40652","observation_id":"116e2fdc-2134-4e72-b837-be93e9df192a","resolution":{"observed_at":"2026-08-05T16:22:51.599569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T16:22:51.603971Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.603971Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:3ad0b9c6bfeff3dc1894bbc71e0d67c8cb7dffe21e5944f28deba4bdc913a316","observation_id":"3fa98f77-b13e-4083-8f07-8d24fc1c566e","resolution":{"observed_at":"2026-08-05T16:22:51.603971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:51.608211Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.608211Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:7a33d16b6b6b101e4806063fe976f9f0bd403b55e27057b3e61df621d20aa4fd","observation_id":"cd6e296d-3ea8-473e-b4a2-77d08c328fd4","resolution":{"observed_at":"2026-08-05T16:22:51.608211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-08-10T03:47:52.773511Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-05T16:22:51.611803Z","title":"Learning to reason with search for llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.611803Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:ec3ba83e60bd34ffdaf0d7815d7f81fd98a847fc84bbdd23f55def5e50cba91f","observation_id":"84ac58dc-b084-4e81-822e-dab037fe247c","resolution":{"observed_at":"2026-08-05T16:22:51.611803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21776","snapshot_observed_at":"2026-08-05T16:22:51.615983Z","title":"Webthinker: Empowering large reasoning models with deep research capability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.615983Z"},"links":{"cited_paper":"/paper/2504.21776","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:643240ce384370d79eaa22e8f7d41e5d16e2b8374c8fc33fbc69fe91c4623033","observation_id":"2a752a56-5318-43b5-8de1-6689bd32a4e0","resolution":{"observed_at":"2026-08-05T16:22:51.615983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.319868Z","title":"Plm-based world models for text-based games","venue":null,"work_id":"9a4ff6ac-d347-4248-8de0-7bb8ca3b20e8","year":2022},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.620068Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:8188ed4188c8ce8417c782ed5d72ece3274aeee2e831f096852af9d8f7e280df","observation_id":"16a9385a-cff2-4ccf-b27f-660bae9b7ddb","resolution":{"observed_at":"2026-08-05T16:22:52.323994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.308843Z","title":"Generative agents: Interactive simulacra of human behavior","venue":null,"work_id":"487099f4-c02c-4091-961f-29efbd5653e0","year":2023},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.623606Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:3a59ccd6a1b8a4ffb66e9da9e1885fdd6c2c8882c2e44696d7853a00f4437ac7","observation_id":"d255c769-1a32-4ece-a74a-6ca7d801855c","resolution":{"observed_at":"2026-08-05T16:22:52.312333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T16:22:51.627300Z","title":"Toolrl: Reward is all tool learning needs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.627300Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:d5d0b9c0a8c8cb83b698b39c88e8c37e751b99c946a51e0d937c8eb6b5165a00","observation_id":"07ad9f53-0fc0-4992-8509-da22c3a4d494","resolution":{"observed_at":"2026-08-05T16:22:51.627300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00024","last_updated":"2025-05-12T03:01:39Z","snapshot_observed_at":"2026-08-07T15:59:20.025064Z","submitted_at":"2025-04-25T02:55:21Z","title":"Nemotron-Research-Tool-N1: Exploring Tool-Using Language Models with Reinforced Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00024","snapshot_observed_at":"2026-08-05T16:22:51.631063Z","title":"Nemotron-research-tool-n1: Tool-using language models with reinforced reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.631063Z"},"links":{"cited_paper":"/paper/2505.00024","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:2a8da00d4b07ae5496f1998f6892ab85301129c1e3dbae68d60eac302eef9234","observation_id":"159b4990-e5c7-4400-b315-9e5dbff73feb","resolution":{"observed_at":"2026-08-05T16:22:51.631063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.298329Z","title":"Reinforcing multi-turn reasoning in llm agents via turn-level credit assignment","venue":null,"work_id":"2260b013-ef3a-4191-8113-717db818d247","year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.634893Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:28e97e12fe4dc8f1b7305c82333eee672e90f8e6909f2ca2e0b3e2f5c26c5849","observation_id":"ed009504-4a98-4e4c-bb84-d7d1fe05d32d","resolution":{"observed_at":"2026-08-05T16:22:52.301977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T16:22:51.638697Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.638697Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:0a6d8ec01821176236d6ef695fac0a0fa3d98307b026a6769808b8af526e362d","observation_id":"28acd782-d161-40c5-9e51-5a45b0b240a9","resolution":{"observed_at":"2026-08-05T16:22:51.638697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T16:22:51.642783Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.642783Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:55e1e7aa39aef093abc296a5ee2e6c6b5d8c96492e82996ea8288be5f391137a","observation_id":"29c0c48d-3474-413f-bc63-c3baff453695","resolution":{"observed_at":"2026-08-05T16:22:51.642783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T16:22:51.646536Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.646536Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:7990b262d0f18bbe94f02beb7a86585a4ac10faeabaddfac16eea325865f309f","observation_id":"99c154c9-34e3-4a41-9e52-733796921874","resolution":{"observed_at":"2026-08-05T16:22:51.646536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-05T16:22:51.650372Z","title":"tau-bench: A benchmark for tool-agent-user interaction in real-world domains","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.650372Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:8c53a0b4b6747e2f6b8aef6ecf1d43806397c9e2b2bc79a02737e428572add3f","observation_id":"c329e446-20e4-4e70-a34b-45e5ac0a92eb","resolution":{"observed_at":"2026-08-05T16:22:51.650372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T16:22:51.654164Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.654164Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:df7878cf3665d79e683ccd09c58ecc8b0e781d0902083562f720f2db059523e6","observation_id":"86f669ba-ffd7-4308-b669-38a751da45e4","resolution":{"observed_at":"2026-08-05T16:22:51.654164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-05T16:22:51.657952Z","title":"tau2-bench: Evaluating conversa- tional agents in a dual-control environment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.657952Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:c5c63563578952f97c0b3fd5ea19a955c2f49623f2674fedbf7737ca591c0883","observation_id":"260d555d-7799-4ba3-93ef-e9f0e6d4d55d","resolution":{"observed_at":"2026-08-05T16:22:51.657952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.286694Z","title":"The berkeley function calling leaderboard (bfcl): From tool use to agentic evaluation of large language models","venue":null,"work_id":"e3740637-2174-408f-be08-892df20b8df9","year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.662318Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:b12c35180fa7c5fd67794d895ec3c30b42c1b559b13b63633a9ad269b1491ecb","observation_id":"89b5a9ae-d96d-434f-aaf2-dc4ff909cb15","resolution":{"observed_at":"2026-08-05T16:22:52.291068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:51.665618Z","title":"Acebench: Who wins the match point in tool usage? arXiv preprint arXiv:2501.12851, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.665618Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:2c7bce58fee5d4fbc7d767aa85a96a7aedbb9f54acad0a79467d7db9d57db5e3","observation_id":"b4a34744-4040-472f-a8f5-24a6df2c4a35","resolution":{"observed_at":"2026-08-05T16:22:51.665618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T16:22:51.669555Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.669555Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:b09ec9f0d0a93c325db5f22e5f35e04feae0b3561d47ecad792ced4ba7cd144d","observation_id":"d533bfd7-f531-4160-bdf8-d683f7845a16","resolution":{"observed_at":"2026-08-05T16:22:51.669555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-05T16:22:51.673650Z","title":"student_id","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.673650Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:ead6c7897c5d65d5953d471bba7eddebdd4dc5f05aefe0708be7559cd26b685a","observation_id":"14f7e64c-b556-46ef-bbd3-11a642a4470e","resolution":{"observed_at":"2026-08-05T16:22:51.673650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.275951Z","title":"term\":\"Sakura","venue":null,"work_id":"c5d6b9c3-332c-4684-88dd-d52fdec1c7f1","year":null},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.677850Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:529c4ed36567198daec6fa5a7faff4287dbb8f7ee56d40b7a6a8baef021ff58c","observation_id":"7cb328aa-1ec2-4dc1-84cd-094d76a1f226","resolution":{"observed_at":"2026-08-05T16:22:52.279618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:22:52.264011Z","title":"02:30:00","venue":null,"work_id":"3cbde483-e6be-42a9-9cce-c669662f32f2","year":null},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.681755Z"},"links":{"citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:a6f38baf02a8cd98c0aa37c2ffe6ead0e3167051b3b4624b96125ee98f681e48","observation_id":"9b796e61-8568-4fab-b7ea-ccc1bd211a66","resolution":{"observed_at":"2026-08-05T16:22:52.268550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 10 inbound Pith citation observations for arXiv:2508.18669."}