{"as_of":"2026-08-10T20:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88e70e65c44e9d8be7f343651a21a89c1cbb935dafe08e67a2f96d62176e5a8e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":78,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:39:03.633077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2504.11536","last_updated":"2025-04-17T16:46:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-15T18:10:22Z","title":"ReTool: Reinforcement Learning for Strategic Tool Use in LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T18:42:39.023650Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2504.11536"},"observation_digest":"sha256:5e9f77e9c3a9aec6d8843d4f739b29f4d81936223273735a48a19be94e10744d","observation_id":"c0ec26f3-934f-475c-a272-d028e2921326","resolution":{"observed_at":"2026-05-13T18:42:39.069463Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2504.21776","last_updated":"2025-10-13T12:40:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-30T16:25:25Z","title":"WebThinker: Empowering Large Reasoning Models with Deep Research Capability","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T19:14:25.283645Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2504.21776"},"observation_digest":"sha256:7ac5609e103b02ea981af97f6bdba4a2ea484e728f128f7fb58090b52529a299","observation_id":"7df66722-4f73-4a07-886d-78b479392da2","resolution":{"observed_at":"2026-05-16T19:14:25.328698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T15:42:27.826306Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-07T17:35:55.668492Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:27.826306Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:e9b54a5af929689e8c2fd2ce76a2f24335ad650506a469ad75caadc0127ec551","observation_id":"242dc923-cbeb-4a5f-93d5-edf32159a6d5","resolution":{"observed_at":"2026-08-07T15:42:27.826306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T15:06:05.394679Z","title":"Torl: Scaling tool-integrated RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.394679Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:e69bfa0a48d3cc69ef966eed9a83b0c13df2f2c410eb91b7f879b41eaac99213","observation_id":"34f7b3a3-7b5c-4681-948c-188b4fc6f61e","resolution":{"observed_at":"2026-08-07T15:06:05.394679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:58:16.110667Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16810","last_updated":"2025-05-26T08:51:17Z","snapshot_observed_at":"2026-08-07T20:42:39.359884Z","submitted_at":"2025-05-22T15:49:38Z","title":"DeepRec: Towards a Deep Dive Into the Item Space with Large Language Model Based Recommendation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:16.110667Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.16810"},"observation_digest":"sha256:22a5a1dd079c531854363386eda2d693565f893e58c108aebbac2badaddb9b6d","observation_id":"f88a0921-bfd6-4689-b5af-88624a1ad566","resolution":{"observed_at":"2026-08-07T14:58:16.110667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:21:19.031069Z","title":"Torl: Scaling tool-integrated RL.CoRR, abs/2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19300","last_updated":"2025-05-25T20:20:04Z","snapshot_observed_at":"2026-08-10T16:55:30.937292Z","submitted_at":"2025-05-25T20:20:04Z","title":"SituatedThinker: Grounding LLM Reasoning with Real-World through Situated Thinking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:21:19.031069Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.19300"},"observation_digest":"sha256:8ab723723a9445c3d03e6eba9689357d9f00d7ddbe74fc1973d673b7d2e13311","observation_id":"79512292-bbd6-4bc9-af93-958343527375","resolution":{"observed_at":"2026-08-07T14:21:19.031069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:05:20.079725Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20128","last_updated":"2025-05-26T15:27:55Z","snapshot_observed_at":"2026-08-07T20:40:53.191299Z","submitted_at":"2025-05-26T15:27:55Z","title":"Iterative Self-Incentivization Empowers Large Language Models as Agentic Searchers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:05:20.079725Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.20128"},"observation_digest":"sha256:b1cab690b9b71caa8a2073c55f639fff19cbf75140b8b34f108c95f1aee40881","observation_id":"5ce54d20-9228-4fce-bc41-0c6183dc2f59","resolution":{"observed_at":"2026-08-07T14:05:20.079725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:01:12.497316Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20296","last_updated":"2025-05-26T17:59:53Z","snapshot_observed_at":"2026-08-09T09:53:26.313801Z","submitted_at":"2025-05-26T17:59:53Z","title":"Reasoning LLMs are Wandering Solution Explorers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:12.497316Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.20296"},"observation_digest":"sha256:1a86690f41f421bee19252a8956cd15cad505020b000620269ee6584cec0520a","observation_id":"7dd91fe7-fa36-4dd1-b7cf-d4b0f6f84d79","resolution":{"observed_at":"2026-08-07T14:01:12.497316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:25:26.808955Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24480","last_updated":"2025-05-30T11:30:18Z","snapshot_observed_at":"2026-08-09T17:09:03.936400Z","submitted_at":"2025-05-30T11:30:18Z","title":"Towards Effective Code-Integrated Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:25:26.808955Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24480"},"observation_digest":"sha256:2f1c3ccec748d446c5f24ad13fefaa32d8759a9944bc5da20092d98d56a2c1be","observation_id":"91035334-31c4-4bf9-8900-7c926ce8639f","resolution":{"observed_at":"2026-08-07T12:25:26.808955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:35:37.503027Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24726","last_updated":"2025-05-30T15:49:42Z","snapshot_observed_at":"2026-08-07T12:12:11.396450Z","submitted_at":"2025-05-30T15:49:42Z","title":"Reflect, Retry, Reward: Self-Improving LLMs via Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:37.503027Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24726"},"observation_digest":"sha256:8bf8d3228d2b8b784db268386c9ccc67b6fca27c53f027becb9696bee072cd76","observation_id":"0b82f9e9-4aab-4d41-aa95-17b48f455999","resolution":{"observed_at":"2026-08-07T12:35:37.503027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T12:16:23.665196Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24878","last_updated":"2025-05-30T17:59:55Z","snapshot_observed_at":"2026-08-07T20:42:02.557956Z","submitted_at":"2025-05-30T17:59:55Z","title":"Open CaptchaWorld: A Comprehensive Web-based Platform for Testing and Benchmarking Multimodal LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:23.665196Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2505.24878"},"observation_digest":"sha256:d739c7f109fadbaa96c0f6ca58e226091c6ce54a569dc653fd9de811cb04dbdb","observation_id":"f7e5c7f2-04d0-407f-88fc-59ac5af16301","resolution":{"observed_at":"2026-08-07T12:16:23.665196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T05:14:47.327873Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-07T09:15:20.058485Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:47.327873Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:522a48e938d75d9c908adb7f4dc0efc7664f3959e7545af07f9e62bcad644850","observation_id":"aca1611a-9a7e-42cc-aac2-3e1b73269c53","resolution":{"observed_at":"2026-08-07T05:14:47.327873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T04:43:18.797764Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09942","last_updated":"2025-06-11T17:10:36Z","snapshot_observed_at":"2026-08-09T16:37:06.908892Z","submitted_at":"2025-06-11T17:10:36Z","title":"VerIF: Verification Engineering for Reinforcement Learning in Instruction Following","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:43:18.797764Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.09942"},"observation_digest":"sha256:a4ec1c9f9d902ed053be8429dbd7058278a2da5ddde4843d83a47ab8003ad95b","observation_id":"215f307f-beb2-4e89-8e06-91b84257bee5","resolution":{"observed_at":"2026-08-07T04:43:18.797764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T00:48:20.031722Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12594","last_updated":"2025-06-14T18:19:05Z","snapshot_observed_at":"2026-08-07T11:53:13.790399Z","submitted_at":"2025-06-14T18:19:05Z","title":"A Comprehensive Survey of Deep Research: Systems, Methodologies, and Applications","version":1},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:20.031722Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.12594"},"observation_digest":"sha256:0947eea22f5af56978f06eb80e607acf2e5cfef9d79926ec428db61334cf9f04","observation_id":"601b0de8-2bed-4708-a7fe-8102af2e7d01","resolution":{"observed_at":"2026-08-07T00:48:20.031722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T00:34:31.307164Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:31.307164Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:3e640a22d68cdf354b046b3724cbba5206ad683101281c3417a8d83d25d182ac","observation_id":"be98b4be-dba1-44c8-bb83-0f574e20da63","resolution":{"observed_at":"2026-08-07T00:34:31.307164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T23:35:04.518537Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17644","last_updated":"2025-06-21T08:56:20Z","snapshot_observed_at":"2026-08-07T23:27:30.726322Z","submitted_at":"2025-06-21T08:56:20Z","title":"Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:04.518537Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.17644"},"observation_digest":"sha256:571e6e347929a1e3d94af2a3d40d9d56cbce3691aa75c90bb0cf9d22c6b301cc","observation_id":"7c9e36bc-fb98-4b7f-90c5-0b5834acc2fa","resolution":{"observed_at":"2026-08-06T23:35:04.518537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T23:11:58.308371Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19171","last_updated":"2025-06-23T22:10:38Z","snapshot_observed_at":"2026-08-08T10:48:33.185126Z","submitted_at":"2025-06-23T22:10:38Z","title":"Distilling Tool Knowledge into Language Models via Back-Translated Traces","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:58.308371Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2506.19171"},"observation_digest":"sha256:a9eef313ac64b69875c6627bc9be3a228d82d70628433006157a75865a4af934","observation_id":"5d1b38b3-89b2-4ed8-a746-8d265c087767","resolution":{"observed_at":"2026-08-06T23:11:58.308371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T19:16:12.930533Z","title":"Torl: Scaling tool-integrated rl,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06127","last_updated":"2025-07-08T16:14:17Z","snapshot_observed_at":"2026-08-08T15:07:59.924275Z","submitted_at":"2025-07-08T16:14:17Z","title":"PrefixAgent: An LLM-Powered Design Framework for Efficient Prefix Adder Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:12.930533Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2507.06127"},"observation_digest":"sha256:ec8a5c440c18921dfa2b4c02ffaae85a42fe3707874c45b64fd8c1d75a9b2e4a","observation_id":"380fa6b6-651c-49c2-94f3-e4a6ef083491","resolution":{"observed_at":"2026-08-06T19:16:12.930533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T13:47:38.217893Z","title":"ToRL: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20199","last_updated":"2025-08-13T10:58:50Z","snapshot_observed_at":"2026-08-07T10:10:33.604674Z","submitted_at":"2025-07-27T09:38:32Z","title":"StepFun-Prover Preview: Let's Think and Verify Step by Step","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:47:38.217893Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2507.20199"},"observation_digest":"sha256:2c0dcfe888a204ec9811d99aff4180abf001394dac2a8d0f940b126012ba75a2","observation_id":"05729999-5f89-4d04-a2cb-2cda13c47ab4","resolution":{"observed_at":"2026-08-06T13:47:38.217893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T12:23:55.175839Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21836","last_updated":"2025-07-29T14:12:28Z","snapshot_observed_at":"2026-08-07T20:39:44.012130Z","submitted_at":"2025-07-29T14:12:28Z","title":"AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T12:23:55.175839Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2507.21836"},"observation_digest":"sha256:349dfc2a4b4e83b97e6d9bb62506d157b778c82d994143ced5df314d080ae94a","observation_id":"4c924188-6d0e-4605-9afb-89eb632f15d7","resolution":{"observed_at":"2026-08-06T12:23:55.175839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T12:09:26.376258Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22034","last_updated":"2025-07-29T17:34:12Z","snapshot_observed_at":"2026-08-07T20:29:47.386254Z","submitted_at":"2025-07-29T17:34:12Z","title":"UserBench: An Interactive Gym Environment for User-Centric Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:26.376258Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2507.22034"},"observation_digest":"sha256:aba3ea8aaf96dc100977ab9c45adb464769b346b81935136c753d6e92621c316","observation_id":"77514045-5d44-4f40-be4c-22d915a50560","resolution":{"observed_at":"2026-08-06T12:09:26.376258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-06T00:03:29.999533Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:29.999533Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:0aaa28096f512f453f757602ecbdca2df88ee388d160ced5ac75cc9b6eb711b7","observation_id":"7a0b5e96-f4a5-4364-a336-25872a9514fc","resolution":{"observed_at":"2026-08-06T00:03:29.999533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T23:57:33.485908Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13167","last_updated":"2025-08-06T17:01:02Z","snapshot_observed_at":"2026-08-05T23:57:29.481263Z","submitted_at":"2025-08-06T17:01:02Z","title":"Chain-of-Agents: End-to-End Agent Foundation Models via Multi-Agent Distillation and Agentic RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:57:33.485908Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.13167"},"observation_digest":"sha256:9a8c0aefdf3c1d75a651b9dac84703a2e0a2ea4ae74dba4860ef0b32c561ff0d","observation_id":"0824de45-a673-4ba2-a2a3-3a113de407a4","resolution":{"observed_at":"2026-08-05T23:57:33.485908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T16:22:51.584383Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18669","last_updated":"2025-08-26T04:26:29Z","snapshot_observed_at":"2026-08-05T16:22:50.856434Z","submitted_at":"2025-08-26T04:26:29Z","title":"MUA-RL: Multi-turn User-interacting Agent Reinforcement Learning for agentic tool use","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:22:51.584383Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.18669"},"observation_digest":"sha256:995b6457f708ee151afbdfd9c26e8d100f1350a0d83ee29ce11970c7af2e8977","observation_id":"a7d18c52-045b-4390-a996-eb97c0cad2ef","resolution":{"observed_at":"2026-08-05T16:22:51.584383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T16:17:16.817954Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18780","last_updated":"2025-08-26T08:04:04Z","snapshot_observed_at":"2026-08-09T15:17:43.072162Z","submitted_at":"2025-08-26T08:04:04Z","title":"Harnessing Rule-Based Reinforcement Learning for Enhanced Grammatical Error Correction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T16:17:16.817954Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.18780"},"observation_digest":"sha256:4f74d65a591fd105b0e7ce18ff9f69660c3d3ad28979cdfed075ce706bb36a5b","observation_id":"6a3e08fd-da83-46f4-8a76-dfd42cea623b","resolution":{"observed_at":"2026-08-05T16:17:16.817954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T15:44:14.848125Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19598","last_updated":"2025-08-27T06:19:50Z","snapshot_observed_at":"2026-08-05T15:44:13.449330Z","submitted_at":"2025-08-27T06:19:50Z","title":"Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T15:44:14.848125Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.19598"},"observation_digest":"sha256:3a0486081bcd11ab7ebbfedbb1658840a262a250e962da8bdc7103bc32cd2e32","observation_id":"f5cc4b08-122f-4dbe-8bac-4bcd6feb5e3f","resolution":{"observed_at":"2026-08-05T15:44:14.848125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T14:57:39.427791Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20722","last_updated":"2025-08-28T12:45:25Z","snapshot_observed_at":"2026-08-09T05:32:48.085714Z","submitted_at":"2025-08-28T12:45:25Z","title":"rStar2-Agent: Agentic Reasoning Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:57:39.427791Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.20722"},"observation_digest":"sha256:209c751cf2ed57b939037c0c16b5ce2ac41d7e0252b77bdf8c2824baee70c6e0","observation_id":"0b4a37c3-6a47-4f09-a775-3a90ffedb885","resolution":{"observed_at":"2026-08-05T14:57:39.427791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T11:39:22.953751Z","title":"ToRL : Scaling Tool-Integrated RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02479","last_updated":"2025-09-03T17:06:42Z","snapshot_observed_at":"2026-08-07T15:24:21.164792Z","submitted_at":"2025-09-02T16:30:19Z","title":"SimpleTIR: End-to-End Reinforcement Learning for Multi-Turn Tool-Integrated Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T11:39:22.953751Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.02479"},"observation_digest":"sha256:414775970abbadb4a01b92da0d86fbd3eb6c771fa45cd0ec0447dfa2b719e539","observation_id":"aa12c784-d0c1-47d4-9e2a-41d1e08b1339","resolution":{"observed_at":"2026-08-05T11:39:22.953751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2509.02544","last_updated":"2025-09-05T14:59:27Z","snapshot_observed_at":"2026-08-05T09:41:26.544360Z","submitted_at":"2025-09-02T17:44:45Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T10:13:58.774968Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.02544"},"observation_digest":"sha256:25ab52455c544fff4d988f36aed724ffe6beb9fcbf8cc970f7a9d783efcb8545","observation_id":"b9f49a87-c1ee-4848-adad-06a39be94915","resolution":{"observed_at":"2026-05-13T10:13:59.036699Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c43a20101145d3ea971090b66c6d2886beb42dcab9299cd4fb1997f1312ea926","observation_id":"7d4cf452-a9e5-41dc-835e-67e5a5324a0f","resolution":{"observed_at":"2026-05-18T19:21:48.647828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T23:55:38.101554Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06283","last_updated":"2025-09-09T02:30:02Z","snapshot_observed_at":"2026-08-08T11:28:39.967324Z","submitted_at":"2025-09-08T02:07:09Z","title":"SFR-DeepResearch: Towards Effective Reinforcement Learning for Autonomously Reasoning Single Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:55:38.101554Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.06283"},"observation_digest":"sha256:bf90033ed0d65f9e1d39e301958cc6b6d91bfd213e27a03c118706d9ea64a4d8","observation_id":"e44d5100-5f37-478c-8a4d-474f38a0c806","resolution":{"observed_at":"2026-08-04T23:55:38.101554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":290,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:24f7fe782b1a9d1d6ad47ff5572f5c417e7eda40b601cdb9abeb9294f9330eb0","observation_id":"70fe5237-d565-4d4d-8b25-e3e90c7d63e2","resolution":{"observed_at":"2026-05-18T00:02:24.780909Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T16:07:33.433285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.433285Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:e4b397cfb6cbf6aa3179e74eff2c5655266f42e758be3b545128fe85d5fe9ad2","observation_id":"ac6d0e7b-4034-494d-b8cf-bf0226db0283","resolution":{"observed_at":"2026-08-04T16:07:33.433285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2509.18847","last_updated":"2026-04-15T06:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-23T09:35:49Z","title":"Failure Makes the Agent Stronger: Enhancing Accuracy through Structured Reflection for Reliable Tool Interactions","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T15:00:51.162221Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2509.18847"},"observation_digest":"sha256:6af9d839700cd09c1db1b0c4c524d0372ebee39bbe8ce5d10459a546f61ff47d","observation_id":"4017163c-30ac-4cba-9d59-a1bcd7e95c4e","resolution":{"observed_at":"2026-05-18T15:01:31.394429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2510.22977","last_updated":"2026-04-17T17:15:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-27T03:58:29Z","title":"The Reasoning Trap: How Enhancing LLM Reasoning Amplifies Tool Hallucination","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T04:09:50.183494Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2510.22977"},"observation_digest":"sha256:bea7b796472e535682d07066ce5ae95485f76ca29dc52c5f284a5d914e54eaae","observation_id":"f3054fae-3073-4eae-82ed-0095c656cfff","resolution":{"observed_at":"2026-05-18T04:10:51.356802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T06:40:24.762093Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10739","last_updated":"2026-08-03T08:17:50Z","snapshot_observed_at":"2026-08-07T08:51:03.458621Z","submitted_at":"2025-12-11T15:26:28Z","title":"Intern-S1-MO: Long-horizon Reasoning Agent for Olympiad?Level Mathematical Problem Solving","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T06:40:24.762093Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2512.10739"},"observation_digest":"sha256:0827994082ed44f40f0f17fdbe45a892568d37caf339c201ff189b8d537b8809","observation_id":"d543d618-6245-4541-a094-87a016794b19","resolution":{"observed_at":"2026-08-04T06:40:24.762093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-03T03:04:43.934885Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025e","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.934885Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:e4e874e1c41fbc254b858c895ca5f68048675bd4d49a02bf93895c912e20537b","observation_id":"e8fec37e-6cc5-425d-950a-b976230eb3af","resolution":{"observed_at":"2026-08-03T03:04:43.934885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2603.16876","last_updated":"2026-05-08T08:14:14Z","snapshot_observed_at":"2026-08-08T17:32:30.075016Z","submitted_at":"2026-02-17T12:48:32Z","title":"Multi-Modal Multi-Agent Reinforcement Learning for Radiology Report Generation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-15T21:51:10.972744Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2603.16876"},"observation_digest":"sha256:bfc1c4348fe2fea44e51c2384ad2afad633da07fec05d4c691a102accefd2731","observation_id":"4fb04403-fcde-49e9-9366-19131b72d040","resolution":{"observed_at":"2026-05-15T21:51:40.765848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.02794","last_updated":"2026-04-03T07:02:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T07:02:13Z","title":"CharTool: Tool-Integrated Visual Reasoning for Chart Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T20:07:23.153064Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.02794"},"observation_digest":"sha256:98a2e2b72b5c634a35400310d642f5609ad8adc3f18ecc4d3805f95271ef78e4","observation_id":"8ef8c2e9-57e1-49e3-8c4c-3e37788322b3","resolution":{"observed_at":"2026-05-13T20:08:12.750849Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.08281","last_updated":"2026-04-17T07:56:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T14:14:37Z","title":"When to Trust Tools? Adaptive Tool Trust Calibration For Tool-Integrated Math Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:04.944348Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.08281"},"observation_digest":"sha256:854152753c5b23e318d81a0c0e64fc9a965e5d2cda5ddb92cb02ddd15afef037","observation_id":"706f8afb-266d-4440-9298-f4ad4fa4182c","resolution":{"observed_at":"2026-05-11T00:10:51.855593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.09455","last_updated":"2026-04-10T16:14:48Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:14:48Z","title":"E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T18:08:18.056525Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.09455"},"observation_digest":"sha256:07086e1cb4593f687e2b1fbb7cce16a5f7c63165c62f1e3b32559480e2e9a9ea","observation_id":"218d5a03-420e-463c-9b2f-0f0cf5ad4642","resolution":{"observed_at":"2026-05-11T05:25:59.826281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:00.503836Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2604.18292"},"observation_digest":"sha256:b5b6b9cddc90a3520f7875a17a1e09ed04fb31202246dabbed195926c2ffb8f2","observation_id":"187e6633-ab0d-4b30-9cb5-7edc87a06037","resolution":{"observed_at":"2026-05-10T05:25:54.216722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.00737","last_updated":"2026-08-06T13:58:03Z","snapshot_observed_at":"2026-08-09T23:12:12.865366Z","submitted_at":"2026-05-01T15:38:13Z","title":"To Call or Not to Call: A Framework to Assess and Optimize LLM Tool Calling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T19:32:57.054584Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.00737"},"observation_digest":"sha256:4b358709bb2e219c67c2e39d6f55d125c900d7faabb2fbc4484b41d14ca8fd94","observation_id":"bcc06785-14f6-4835-beb0-663c880a8336","resolution":{"observed_at":"2026-05-11T15:36:10.366674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-09T22:35:00.024991Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:bb190689dedd3e33a1224c51a961f4d59ada4ae0719e493b98921a8d035b3095","observation_id":"2001a2f7-cab5-4e06-993e-153caaf1c8bb","resolution":{"observed_at":"2026-05-11T03:30:58.761107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T05:20:45.032153Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-09T22:35:00.024991Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T05:20:45.032153Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:a54a541f12451b4b8a4036f67571b0f45bf30c02c4639962212525aff88a8dd8","observation_id":"7a1abce0-7186-407a-84da-7f16f046f19a","resolution":{"observed_at":"2026-08-04T05:20:45.032153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.09931","last_updated":"2026-05-11T03:28:43Z","snapshot_observed_at":"2026-08-03T02:44:35.388736Z","submitted_at":"2026-05-11T03:28:43Z","title":"PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:49.165066Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.09931"},"observation_digest":"sha256:6c8b65c70d162067a56532db3ce474c512f8813a7830e2fac08cfa93e46d01ef","observation_id":"8d5585b9-95a3-409d-81b0-3bb2dd92a7b2","resolution":{"observed_at":"2026-05-12T06:01:23.221704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.10787","last_updated":"2026-05-20T01:39:17Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:20:51Z","title":"ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T04:42:47.496496Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.10787"},"observation_digest":"sha256:bbe8c67de9171e9806defb5a3352554e6888e269ce5d8356a729d971195c3e9d","observation_id":"fa50e7bb-92cb-4f0a-9e52-486162a28127","resolution":{"observed_at":"2026-05-12T06:01:23.444039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.10787","last_updated":"2026-05-20T01:39:17Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:20:51Z","title":"ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-21T08:08:04.544564Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.10787"},"observation_digest":"sha256:1631f6435e649065cd6fc8bd0b5b75fd747e912b0a413b9dd1bd88fb2bac72f0","observation_id":"e38e9970-45c9-415f-8c2f-b14b8d94550d","resolution":{"observed_at":"2026-05-21T08:09:51.260787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.17734","last_updated":"2026-05-18T01:35:11Z","snapshot_observed_at":"2026-07-06T23:28:41.111402Z","submitted_at":"2026-05-18T01:35:11Z","title":"Harnessing LLM Agents with Skill Programs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T11:26:19.382463Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.17734"},"observation_digest":"sha256:88524798b5320aa0a287f5a7144fbb861d24d025cbeb5d44f3bb7f07e195e232","observation_id":"160a545c-9bd6-4ab7-ba7d-e17491a1ca7a","resolution":{"observed_at":"2026-05-20T11:28:14.372406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.27788","last_updated":"2026-05-27T00:11:31Z","snapshot_observed_at":"2026-08-10T00:44:03.306932Z","submitted_at":"2026-05-27T00:11:31Z","title":"Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:58.677299Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.27788"},"observation_digest":"sha256:00555a909cdf2e963a0ab0ca5d236d1ec43cb35d44e24e5b6d2231a8039dacfd","observation_id":"d07a6f08-b72c-426f-944b-2693cdfc2f61","resolution":{"observed_at":"2026-06-29T13:53:28.597051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.28774","last_updated":"2026-05-27T17:36:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:36:39Z","title":"Agent Explorative Policy Optimization for Multimodal Agentic Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T12:22:39.655615Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.28774"},"observation_digest":"sha256:0400064314d84f1676e2444dc95f80d54801e08c1849b647393b137bd5c5b486","observation_id":"0cd270cd-f03b-4a05-b28a-9734d0724f15","resolution":{"observed_at":"2026-06-29T12:23:24.097141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2605.28774","last_updated":"2026-05-27T17:36:39Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:36:39Z","title":"Agent Explorative Policy Optimization for Multimodal Agentic Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-29T12:22:39.655615Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2605.28774"},"observation_digest":"sha256:337c86350111dd453e5a05b284250616ad2d0c5016dd0381dc08ee32675f67fc","observation_id":"c528edd2-8f50-4d0b-aee0-6209ce4db83c","resolution":{"observed_at":"2026-06-29T12:23:23.709428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.03762","last_updated":"2026-06-02T15:16:12Z","snapshot_observed_at":"2026-08-02T17:38:14.832178Z","submitted_at":"2026-06-02T15:16:12Z","title":"Tool-Aware Optimization with Entropy Guidance for Efficient Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T11:19:31.702516Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.03762"},"observation_digest":"sha256:4abb2b2e6e2c7ae85c171a1d64ee3a414d474c672c423fa41befedb390c2f900","observation_id":"89728c42-fa89-46bf-94cc-d12ce2f5c9bb","resolution":{"observed_at":"2026-07-02T02:06:26.298738Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.07074","last_updated":"2026-06-05T09:10:50Z","snapshot_observed_at":"2026-07-06T23:46:46.925980Z","submitted_at":"2026-06-05T09:10:50Z","title":"SlimSearcher: Training Efficiency-Aware Web Agents via Adaptive Reward Gating","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T22:54:44.329613Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.07074"},"observation_digest":"sha256:b3eb6ec556b42f21e0efde9e431a28fa54e8dc5f58bbeae71b5920f944200d64","observation_id":"3385bd01-37da-4c78-8fe7-45aac4978f0c","resolution":{"observed_at":"2026-07-02T16:17:08.740016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.09371","last_updated":"2026-06-08T11:48:55Z","snapshot_observed_at":"2026-08-06T09:58:48.976204Z","submitted_at":"2026-06-08T11:48:55Z","title":"Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T16:43:00.259139Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.09371"},"observation_digest":"sha256:b381b501d6c2e8dc99836fd30b7d4e6512d53fb64c776c510fc427d7a8920e16","observation_id":"527b852c-249b-406e-bffd-26a8d7b36d08","resolution":{"observed_at":"2026-07-03T01:17:30.699154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.10875","last_updated":"2026-06-09T13:51:32Z","snapshot_observed_at":"2026-08-05T02:50:02.993079Z","submitted_at":"2026-06-09T13:51:32Z","title":"Pushing the Limits of LLM Tool Calling via Experiential Knowledge Integration and Activation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:23:42.745788Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.10875"},"observation_digest":"sha256:dd37db4779e4129288384562c60775e567b11367883f70737518590f1b88b07a","observation_id":"8813d5a7-129f-4fa4-8f6f-300c3a5cb865","resolution":{"observed_at":"2026-07-03T05:07:39.261630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.11652","last_updated":"2026-06-10T04:30:37Z","snapshot_observed_at":"2026-08-07T14:14:25.800605Z","submitted_at":"2026-06-10T04:30:37Z","title":"IAPO: Input Attribution-Aware Policy Optimization for Tool Use in Small Multimodal Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T10:57:55.875707Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.11652"},"observation_digest":"sha256:a4a850c4d80327610935f6a0c40976574f869ae587282d79ec4c7bdc55fbcc36","observation_id":"89052348-3a9c-4647-871f-62b814bbd5d7","resolution":{"observed_at":"2026-07-03T08:17:45.064660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T10:21:55.485624Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:a0066050bf371be7f44904c85440871bea896cf62f40b876ba928835232d4648","observation_id":"8a2e1419-c0c5-4db1-9992-b40160bc9eb4","resolution":{"observed_at":"2026-07-03T09:37:49.403443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-03T02:12:28.554279Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T23:10:46.327902Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:28.554279Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:02cacc1c03a04379660505cda464b49e522e19d39d580539858fd4ee821d6297","observation_id":"73e0d108-c07f-4b76-95e9-cbeb0f34d7fa","resolution":{"observed_at":"2026-08-03T02:12:28.554279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.12908","last_updated":"2026-06-11T05:06:50Z","snapshot_observed_at":"2026-08-05T04:59:46.668803Z","submitted_at":"2026-06-11T05:06:50Z","title":"SENTINEL: Failure-Driven Reinforcement Learning for Training Tool-Using Language Model Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-27T06:49:12.070481Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.12908"},"observation_digest":"sha256:d2391c18f2768ce69ca450180c3bbec69c7572fa0c06828ad9c91ddefec7d8da","observation_id":"f3056329-2a84-46e7-a6ac-8d65e3d85169","resolution":{"observed_at":"2026-07-03T14:58:33.209084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:a69e93a9a39771e9c0a917bfecdb82beb8185c2a21c557d8e421c5dfde218910","observation_id":"206a8438-71f8-4e3a-8575-8313c113c327","resolution":{"observed_at":"2026-07-04T08:09:40.636889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.26027","last_updated":"2026-06-24T16:55:56Z","snapshot_observed_at":"2026-08-10T18:28:15.087649Z","submitted_at":"2026-06-24T16:55:56Z","title":"Why Multi-Step Tool-Use Reinforcement Learning Collapses and How Supervisory Signals Fix It","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-25T19:28:36.499352Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.26027"},"observation_digest":"sha256:b7bc52f5f08ebf3ff85931852c905285ab379fe360df6b4f390698b5a28f397a","observation_id":"23264379-35df-4bd4-bf00-2e6d31f696a2","resolution":{"observed_at":"2026-07-04T20:50:12.369980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:54.960194Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:de875968d90f0e97dc576a05f4e34c9f05893819b96488250d5e6a78e7e7474f","observation_id":"baa37537-78f8-422b-b35c-ec386e6386c2","resolution":{"observed_at":"2026-07-01T09:45:40.244054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-07-13T07:12:34.663753Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T07:12:34.663753Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:b0e786f97cea864a2bbc09eb3d88a638e5362de10ec904e7387a54002278f28f","observation_id":"6ebedfcc-fc11-4d90-97d7-91509a9fdb01","resolution":{"observed_at":"2026-07-13T07:12:34.663753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-02T09:17:12.937563Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T09:17:12.937563Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:d60225291f69a94e8b5fcdcad020d6879d3aa3ac202c57317959124109653fc3","observation_id":"e3b45eb5-c77a-4597-bb91-d81577474950","resolution":{"observed_at":"2026-08-02T09:17:12.937563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-03T02:05:44.909805Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T02:05:44.909805Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:90109fa91d92f01f254b63fcd89a7d7c53b594ce4ccfde5c6fa1b64a14fc02f4","observation_id":"85bdd02c-b90a-4538-b798-a0eae5c34095","resolution":{"observed_at":"2026-08-03T02:05:44.909805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T04:36:25.292766Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.31650","last_updated":"2026-08-03T09:35:31Z","snapshot_observed_at":"2026-08-06T23:31:36.019905Z","submitted_at":"2026-06-30T13:29:58Z","title":"ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T04:36:25.292766Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2606.31650"},"observation_digest":"sha256:9a10687fdbcf0343641db34a569b58a70e8c88f5a95f665987f4d102a5dda462","observation_id":"bcee6077-162f-49d4-b9ec-4b8b61e6d5cd","resolution":{"observed_at":"2026-08-04T04:36:25.292766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":"2503.23383","doi":"10.48550/arxiv.2503.23383","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":"ArXiv.org","work_id":"aec6658a-b95b-4edc-942e-10f5203b0b6b","year":2025},"citing_paper":{"arxiv_id":"2607.01084","last_updated":"2026-07-01T15:40:25Z","snapshot_observed_at":"2026-08-07T08:23:08.883776Z","submitted_at":"2026-07-01T15:40:25Z","title":"Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-02T12:16:47.299349Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.01084"},"observation_digest":"sha256:40d5fd61ea8e7202c2c8cc84c6b871e6c5445a5ac3aae0a174329c6d7392a768","observation_id":"cbe8b569-abbf-4213-be6e-ee19d8d30bbf","resolution":{"observed_at":"2026-07-02T12:16:56.326575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:069733d3ed8108675968cb9a6d0c9612765cda7a194f5ed8f115643a534e5fd4","observation_id":"b57a85d3-e8bc-44e0-b596-f4f14bc7aa84","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-07-11T14:43:39.668059Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04713","last_updated":"2026-07-06T06:32:39Z","snapshot_observed_at":"2026-08-07T20:40:56.219597Z","submitted_at":"2026-07-06T06:32:39Z","title":"RSPO: Reward-Swap Policy Optimization for Multi-Turn LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T14:43:39.668059Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.04713"},"observation_digest":"sha256:460375a8c56b9f6544dc413566c47d395a6bf82a55192dbb25036b95f67e303b","observation_id":"bc658aa5-335e-456c-bbc8-569f751eb622","resolution":{"observed_at":"2026-07-11T14:43:39.668059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-01T22:12:53.833936Z","title":"org/abs/2503.23383","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15845","last_updated":"2026-07-27T13:53:28Z","snapshot_observed_at":"2026-08-07T14:55:46.129479Z","submitted_at":"2026-07-17T11:03:01Z","title":"Knowledge-Centric Agents for Workflow Generation in ComfyUI","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T22:12:53.833936Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.15845"},"observation_digest":"sha256:ed2e86c52835e5f35358209445d8b505ee3f9d5679f486f8854d7706e32c0aac","observation_id":"012ef096-fe13-4c84-b804-db4c759c726e","resolution":{"observed_at":"2026-08-01T22:12:53.833936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-01T13:52:49.091047Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.091047Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:bfc4164aa6ac9d581f5d0b50167941f57eda9ff25dec1c6e0dd8f52d3d015f34","observation_id":"e8d2fc97-d1e1-45c2-985b-edf2ec06025b","resolution":{"observed_at":"2026-08-01T13:52:49.091047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-01T22:56:53.271564Z","title":"ToRL: Scaling tool-integrated RL.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22688","last_updated":"2026-07-17T02:39:57Z","snapshot_observed_at":"2026-08-07T21:59:25.588421Z","submitted_at":"2026-07-17T02:39:57Z","title":"Co-Harness: Co-Evolving Harnesses and Model Weights for LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T22:56:53.271564Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.22688"},"observation_digest":"sha256:38f15c4e41c086449b5b32d1fb2eaa40af06ed6be95a9f896be98713ccc54bb1","observation_id":"f134a709-de0c-4f9d-9fbf-e0f22b86e1b4","resolution":{"observed_at":"2026-08-01T22:56:53.271564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T23:23:14.645199Z","title":"10 Xuefeng Li, Haoyang Zou, and Pengfei Liu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-09T13:33:19.122605Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.645199Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:10ba5fad9c13bae57d6f8f6f00ea83fb02eeed13fe76587cb712d6feb732c74a","observation_id":"8b721a9c-415e-4ccb-a10e-af5f6890dec9","resolution":{"observed_at":"2026-08-04T23:23:14.645199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-04T23:05:27.937398Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01678","last_updated":"2026-08-03T04:14:59Z","snapshot_observed_at":"2026-08-07T11:35:10.108951Z","submitted_at":"2026-08-03T04:14:59Z","title":"Progressive Agent Skill Generation via Reinforcement Learning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T23:05:27.937398Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.01678"},"observation_digest":"sha256:ac8e10c7fe3c2bd569e12a65f227e66653f7c12051f59f3afe60322049f1933e","observation_id":"05877cd5-5ffe-4f1a-9b12-286a45b46ca7","resolution":{"observed_at":"2026-08-04T23:05:27.937398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T21:49:39.554840Z","title":"Nebius AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05886","last_updated":"2026-08-06T11:07:42Z","snapshot_observed_at":"2026-08-10T15:43:25.358230Z","submitted_at":"2026-08-06T11:07:42Z","title":"CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:49:39.554840Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.05886"},"observation_digest":"sha256:431698ad9283d76e192580588882cd517d6d52ecf1b72af731e5510361342a8d","observation_id":"927b7980-bf7f-4d01-b64b-5900562bc05e","resolution":{"observed_at":"2026-08-07T21:49:39.554840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-07T14:27:44.357730Z","title":"arXiv preprint arXiv:2503.23383 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06128","last_updated":"2026-08-07T02:16:01Z","snapshot_observed_at":"2026-08-10T20:09:51.453772Z","submitted_at":"2026-08-06T15:01:29Z","title":"Contextual Information Policy Optimization for Search Agents","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T14:27:44.357730Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.06128"},"observation_digest":"sha256:8b7212d3c3cffb5771a4559484aaf17a3dfadfa4cc6c4f2aeb0c1fe87fc66c31","observation_id":"ffc6c40f-2636-40c7-a5d1-2b2f38aca1c8","resolution":{"observed_at":"2026-08-07T14:27:44.357730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-10T04:39:03.633077Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07437","last_updated":"2026-08-07T17:22:00Z","snapshot_observed_at":"2026-08-10T20:12:15.979570Z","submitted_at":"2026-08-07T17:22:00Z","title":"Fisher-R1: Training LLM Agents for Reliable Hypothesis Testing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T04:39:03.633077Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2608.07437"},"observation_digest":"sha256:43e1c86cb47690cba2613ebfe127fa2f0415ff8151b72d37e42f009edb865795","observation_id":"3c61b79c-030c-42a0-88ff-cbac19d0b4fb","resolution":{"observed_at":"2026-08-10T04:39:03.633077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.23383/citation-record","integrity":"/paper/2503.23383/integrity","json":"/paper/2503.23383/citation-record.json","paper":"/paper/2503.23383"},"outbound":[],"paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 78 inbound Pith citation observations for arXiv:2503.23383."}