{"as_of":"2026-08-13T12:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19e402e7162d9ff40261d1889112ae71e185a6b4c6f4d7c9d067ef4e35efec3e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:17:44.662944Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2510.13727","last_updated":"2026-05-19T04:39:26Z","snapshot_observed_at":"2026-08-02T19:37:00.796741Z","submitted_at":"2025-10-15T16:30:57Z","title":"From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T20:42:40.823721Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2510.13727"},"observation_digest":"sha256:0a6db4ac4d0b06720e3c8e227b94ee4062618ec7c93db62cc0b52c130b106fa3","observation_id":"ab033493-353e-4c3c-86e5-a01590349bc5","resolution":{"observed_at":"2026-05-21T20:44:22.032163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-04T07:17:44.662944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26270","last_updated":"2026-05-28T11:04:33Z","snapshot_observed_at":"2026-08-10T01:18:05.688661Z","submitted_at":"2025-10-30T08:53:41Z","title":"Graph-Enhanced Policy Optimization in LLM Agent Training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T07:17:44.662944Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2510.26270"},"observation_digest":"sha256:62afb0c629bc5442ad3a4b83962697e878d49eb3370f043389f19bc9a298eb7b","observation_id":"1bac4949-4614-4099-84cb-bf272862a396","resolution":{"observed_at":"2026-08-04T07:17:44.662944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2601.06794","last_updated":"2026-04-14T15:14:10Z","snapshot_observed_at":"2026-08-11T18:50:48.257351Z","submitted_at":"2026-01-11T07:29:08Z","title":"No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T16:01:48.789986Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2601.06794"},"observation_digest":"sha256:a0c07a19c6ff0496af2a63549072e9a02ebb450a18d66705c438e3f7ddbf0ceb","observation_id":"65ecc095-b3c4-4c04-8fd5-45bd71d0c2f1","resolution":{"observed_at":"2026-05-16T16:03:04.350165Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T23:41:44.971735Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-13T06:22:18.671426Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.971735Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:8a738f7e2c2c02bcf8d5ce1e087df4920a29dc9a095a9ca01300c45519053131","observation_id":"521c8bd2-31d2-4ddf-bc5f-0bfa840077e2","resolution":{"observed_at":"2026-08-02T23:41:44.971735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2603.00977","last_updated":"2026-05-05T03:37:16Z","snapshot_observed_at":"2026-08-02T14:44:32.701926Z","submitted_at":"2026-03-01T08:09:03Z","title":"HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T18:35:45.900606Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2603.00977"},"observation_digest":"sha256:ed8f97fcb4b64fe8e98cecc3130fbb5baeb11ce57f95e2e85a35e4405e0d330c","observation_id":"62076d23-5f87-47e3-b40e-a118ffdc1d62","resolution":{"observed_at":"2026-05-15T18:36:28.302124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2604.18133","last_updated":"2026-04-20T12:00:31Z","snapshot_observed_at":"2026-08-11T20:43:33.503498Z","submitted_at":"2026-04-20T12:00:31Z","title":"Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T04:31:28.242097Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2604.18133"},"observation_digest":"sha256:600a1cdc6e12250bb932c68226523630018ddc35072587d59ad24426b71750c4","observation_id":"80e94209-9660-4f03-9d68-3a17f887eee7","resolution":{"observed_at":"2026-05-11T11:51:04.003863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2604.18975","last_updated":"2026-04-21T01:58:02Z","snapshot_observed_at":"2026-08-11T16:58:32.752956Z","submitted_at":"2026-04-21T01:58:02Z","title":"Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T02:03:01.533652Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2604.18975"},"observation_digest":"sha256:ac25d4ab975666d9fd318d1e73a61ec61f54218e7f9131cc6723440c9a0c8002","observation_id":"a0a00fb7-0848-4b85-af89-ff144e01af2a","resolution":{"observed_at":"2026-05-11T13:16:10.668460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2604.20572","last_updated":"2026-06-04T08:43:34Z","snapshot_observed_at":"2026-08-11T05:04:46.791682Z","submitted_at":"2026-04-22T13:50:55Z","title":"Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T00:07:50.798934Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2604.20572"},"observation_digest":"sha256:42bb061ca85bf725e57ca584ac11d87a082eb1d8f99e5751345ef900d37e408a","observation_id":"3f2fe3ee-5043-4fd1-86a5-ce7f9e1e0052","resolution":{"observed_at":"2026-05-10T00:24:47.266164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.02572","last_updated":"2026-05-04T13:25:05Z","snapshot_observed_at":"2026-08-11T14:22:19.633592Z","submitted_at":"2026-05-04T13:25:05Z","title":"On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T18:13:25.735085Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.02572"},"observation_digest":"sha256:565ec2c0da57ef3a1411661c6a1f61f4b454c4763630fc3a9fe924765baded46","observation_id":"d56ae31f-1127-4d63-8d06-b6f79feefa8a","resolution":{"observed_at":"2026-05-09T06:40:40.777758Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.06642","last_updated":"2026-05-07T17:51:16Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:51:16Z","title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T09:59:48.604813Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.06642"},"observation_digest":"sha256:369a3c506b9e45e061ed5f03c62f21207e860dfce9a92f59f1c514e22db3780b","observation_id":"62f24da8-3e94-423f-9baa-ad1e2f5b43ee","resolution":{"observed_at":"2026-05-11T20:11:12.218032Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.06761","last_updated":"2026-05-07T17:17:10Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:17:10Z","title":"Weblica: Scalable and Reproducible Training Environments for Visual Web Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:44.578007Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.06761"},"observation_digest":"sha256:27dd6586632eb5ad0b7d14e07fe575eaae9528548c1ddfa997fb5ada3097c6b5","observation_id":"1e85163d-8550-442e-9751-e64bd6830b91","resolution":{"observed_at":"2026-05-11T04:25:56.957645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.08715","last_updated":"2026-05-13T23:06:48Z","snapshot_observed_at":"2026-08-13T11:33:12.034864Z","submitted_at":"2026-05-09T05:55:19Z","title":"AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T01:19:49.062330Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.08715"},"observation_digest":"sha256:7cd92b082c89f5fb9599fa278cd4b1e51a9dadff5ec550cce17e5e5e0ea0149c","observation_id":"8088afa4-dd0d-4fa3-8c33-a1292a4c46b5","resolution":{"observed_at":"2026-05-12T08:06:27.547132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.08715","last_updated":"2026-05-13T23:06:48Z","snapshot_observed_at":"2026-08-13T11:33:12.034864Z","submitted_at":"2026-05-09T05:55:19Z","title":"AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T05:24:54.265411Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.08715"},"observation_digest":"sha256:4dcc90e2ae61f89003431bbc1da564bb86ae81ff550f603a32c54d6f64962f47","observation_id":"a6a7d221-1648-47b6-aefe-2964ec339729","resolution":{"observed_at":"2026-05-15T05:25:03.885299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.11706","last_updated":"2026-05-12T07:59:41Z","snapshot_observed_at":"2026-08-11T02:45:32.817529Z","submitted_at":"2026-05-12T07:59:41Z","title":"GRAFT: Graph-Tokenized LLMs for Tool Planning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T07:22:03.560420Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.11706"},"observation_digest":"sha256:be11ceb7341b117fb3c1965213d87a4afb9ba3e6a533d09307162ab1cbf06e8d","observation_id":"f9d5f345-c44a-4e88-8985-0fe8803df340","resolution":{"observed_at":"2026-05-13T07:22:28.269254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T07:30:41.399083Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:eb97a0c08e988809157c5dea76ed2320f0f79802c9bc3f02c4b9a721b4652d16","observation_id":"d857d5c2-67c7-46cb-a55c-bc15d944de6b","resolution":{"observed_at":"2026-05-13T07:32:28.836944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:bee3ac487a902beb1a6b4b5817e27a06c5a0e283dc283dda2f469a5a5a5f4c09","observation_id":"199a2e9b-eb9a-4a3a-940b-4e6a27353c78","resolution":{"observed_at":"2026-05-15T06:05:05.669079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.12289","last_updated":"2026-05-12T15:47:18Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:47:18Z","title":"PriorZero: Bridging Language Priors and World Models for Decision Making","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T05:25:05.907123Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.12289"},"observation_digest":"sha256:7c04f472c542efd95d3c90722e0a57300d253b0ef717eb39ba5de426739deda0","observation_id":"72827b3b-f976-4a54-9e0e-970c19d50e4d","resolution":{"observed_at":"2026-05-13T05:27:18.624132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.14558","last_updated":"2026-05-14T08:33:02Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:33:02Z","title":"Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T01:46:24.724553Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.14558"},"observation_digest":"sha256:43cfab34b775248e077bb126e3e684b7d414c506ab3f5eda0a187c49f4ae4bcd","observation_id":"468889c8-af3e-4213-baa3-d9b4c468334a","resolution":{"observed_at":"2026-05-15T01:48:28.618421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.15224","last_updated":"2026-05-13T08:50:05Z","snapshot_observed_at":"2026-08-08T09:54:59.992034Z","submitted_at":"2026-05-13T08:50:05Z","title":"ICRL: Learning to Internalize Self-Critique with Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-19T17:58:05.817581Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.15224"},"observation_digest":"sha256:e326493d0b33408aa20953108476e53094ab0d39530ababc47440fd9ca2ae0e3","observation_id":"e1ac94f0-db25-4541-9ebc-593bb43dfd4e","resolution":{"observed_at":"2026-05-19T18:02:42.395542Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-07T09:15:12.932880Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:b1b2d01aace63c00acf35662a75c6a5c02c2f718606a851003830522fb5447e9","observation_id":"b59c1e80-b311-4087-a119-9dbbe090a57a","resolution":{"observed_at":"2026-05-20T05:38:05.470067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.27760","last_updated":"2026-05-26T23:18:43Z","snapshot_observed_at":"2026-07-06T23:37:27.309837Z","submitted_at":"2026-05-26T23:18:43Z","title":"SkillGrad: Optimizing Agent Skills Like Gradient Descent","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T16:46:09.930635Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.27760"},"observation_digest":"sha256:a26ba919467a8f8319557086141d487a7851ae27997c15e24554e3ae8eb56091","observation_id":"8d583fbf-e3c7-403d-b117-3b59177e3305","resolution":{"observed_at":"2026-06-29T16:53:41.304135Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-06T23:48:50.589215Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:ed8600e83fe201c2596b774a9044cc7b761381f10e31ac49bf38572b42860e11","observation_id":"6b1e739c-bb86-4664-9402-992f048bad50","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T09:45:49.609534Z","title":"Agentgym- rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.609534Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:500fe5dd8849ca68e8fb02bc2a7b4ad191fd2229a93ffb88dd96683d9e6510c4","observation_id":"763e6f28-3062-4056-96fa-b9052d9b42fb","resolution":{"observed_at":"2026-08-02T09:45:49.609534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T08:56:35.257327Z","title":"(2025).AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning.CoRR, abs/2509.08755.https://doi.org/10.48550/arXiv.2509.08755","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19395","last_updated":"2026-07-03T05:07:22Z","snapshot_observed_at":"2026-08-07T06:27:15.086404Z","submitted_at":"2026-07-03T05:07:22Z","title":"From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:35.257327Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.19395"},"observation_digest":"sha256:66b984db72d9783d1ba29ca96af794903ae74fa502e6baa5417def71d6a98a55","observation_id":"1a45e017-0649-429c-b45c-3054a1e94154","resolution":{"observed_at":"2026-08-02T08:56:35.257327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-01T12:36:12.420962Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19523","last_updated":"2026-07-21T19:10:38Z","snapshot_observed_at":"2026-08-06T11:26:29.786981Z","submitted_at":"2026-07-21T19:10:38Z","title":"When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T12:36:12.420962Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.19523"},"observation_digest":"sha256:132dc464ba2915d15725844598e459e3ebd23bf7b5b30531fa922ea4b50ed1a7","observation_id":"1934517f-cac9-4a64-9ac3-74851e6dce68","resolution":{"observed_at":"2026-08-01T12:36:12.420962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-07-30T21:12:59.428554Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26784","last_updated":"2026-07-29T11:26:33Z","snapshot_observed_at":"2026-08-09T01:01:14.362201Z","submitted_at":"2026-07-29T11:26:33Z","title":"SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T21:12:59.428554Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.26784"},"observation_digest":"sha256:969305b9caec8c2802252cb5f2d4e69aec6e170a8b58acf51d58ba62845092bb","observation_id":"4e2c48f9-e951-48b3-8d4a-71238d638059","resolution":{"observed_at":"2026-07-30T21:12:59.428554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08755/citation-record","integrity":"/paper/2509.08755/integrity","json":"/paper/2509.08755/citation-record.json","paper":"/paper/2509.08755"},"outbound":[],"paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T20:46:22.343022Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2509.08755."}