{"as_of":"2026-08-10T15:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc74a07ed0ac89b110092a5532d4cd48a5837d27bd19789964cae501288735e1","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:53:52.797095Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05080/citation-record","integrity":"/paper/2608.05080/integrity","json":"/paper/2608.05080/citation-record.json","paper":"/paper/2608.05080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.431756Z","title":"Assumption C.6 is the stability condition connecting the controller analysis to policy optimization","venue":null,"work_id":"c2a3cd98-4ea4-452a-9f71-4c037168b8f8","year":2014},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.789280Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:a94460aeafd08537f73685fed1f8e9eb2059b93129a1a630ecd207e2466d3e8d","observation_id":"a1297d76-745d-4ed0-b42b-eb4cdfa6d4eb","resolution":{"observed_at":"2026-08-06T05:53:54.435100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05149","last_updated":"2026-04-06T20:24:54Z","snapshot_observed_at":"2026-07-06T22:53:55.926521Z","submitted_at":"2026-04-06T20:24:54Z","title":"EvolveRouter: Co-Evolving Routing and Prompt for Multi-Agent Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.05149","snapshot_observed_at":"2026-08-06T05:53:52.726238Z","title":"Evolverouter: Co- evolving routing and prompt for multi-agent question answering.arXiv preprint arXiv:2604.05149,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.726238Z"},"links":{"cited_paper":"/paper/2604.05149","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:fb4f3dc42ab1625c623e3f3318b59a0933d1604c86940dd51abc7bcdf4828ff5","observation_id":"c5f83f90-9fa2-41f6-820a-a27d5847c104","resolution":{"observed_at":"2026-08-06T05:53:52.726238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.729206Z","title":"Tree search for llm agent reinforcement learning.arXiv preprint arXiv:2509.21240,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.729206Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:f7776c9f4ffe613a206be6efec484b8d19405355cf3395ce2bc9154e714a5f78","observation_id":"e1ee55ea-e882-4ff7-b926-c5183599e476","resolution":{"observed_at":"2026-08-06T05:53:52.729206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T05:53:52.736354Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.736354Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:d1bb52bbb420365080c9322d08e97043e689724f2a80a4e1b0a3d9ab34beb929","observation_id":"9b314d96-44a0-40c2-aeb1-33fb9af16d44","resolution":{"observed_at":"2026-08-06T05:53:52.736354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.739218Z","title":"Adaptive rollout allocation for online reinforcement learning with verifiable rewards.arXiv preprint arXiv:2602.01601,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.739218Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:e8e3d4a4df5c62a1c98bbce23270febdb320de7760a734f5841f638cbf1c0faa","observation_id":"b770c64f-c6f7-468a-9cce-d88cb13e5802","resolution":{"observed_at":"2026-08-06T05:53:52.739218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.741571Z","title":"Group distribu- tionally robust optimization-driven reinforcement learning for llm reasoning.arXiv preprint arXiv:2601.19280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.741571Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:9eb75c2275b5d097870e0439a23ffe2f944a382256d03676fd1b53cd1c64b806","observation_id":"824626db-cf8b-4f7e-b9ee-082df4fc9507","resolution":{"observed_at":"2026-08-06T05:53:52.741571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11512","last_updated":"2026-06-09T23:17:16Z","snapshot_observed_at":"2026-08-02T13:42:35.529591Z","submitted_at":"2026-06-09T23:17:16Z","title":"SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment","version":1},"cited_work":{"arxiv_id":"2606.11512","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11512","snapshot_observed_at":"2026-08-06T05:53:53.755869Z","title":"SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment","venue":"cs.CL","work_id":"995d10eb-a791-45e8-9c95-99aae97937cb","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.746640Z"},"links":{"cited_paper":"/paper/2606.11512","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:bfcfd3852aa4810ab8213d31f4ef064ac7fb64665b51784da71f15de77b761d4","observation_id":"ae3eb28e-29f0-4e35-8350-1a307876aa15","resolution":{"observed_at":"2026-08-06T05:53:53.759426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06268","last_updated":"2026-04-07T04:29:41Z","snapshot_observed_at":"2026-07-06T22:54:48.916799Z","submitted_at":"2026-04-07T04:29:41Z","title":"RAGEN-2: Reasoning Collapse in Agentic RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06268","snapshot_observed_at":"2026-08-06T05:53:52.749306Z","title":"Ragen-2: Reasoning collapse in agentic rl.arXiv preprint arXiv:2604.06268,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.749306Z"},"links":{"cited_paper":"/paper/2604.06268","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:3c4081602548a0f82f0fa360e6c76e617f6b459d10faa4088a9afb6aefb6d81e","observation_id":"edbb19bf-4184-4a46-a168-220e7f27a0d8","resolution":{"observed_at":"2026-08-06T05:53:52.749306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.751646Z","title":"Entropy-tree: Tree-based decoding with entropy-guided exploration.arXiv preprint arXiv:2601.15296,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.751646Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:32cc789e2f8c5f2b0defdee4d399de3f8ed5040650bc7d65df7194662c94488d","observation_id":"cc6ba695-5295-4b4a-98c2-932ca0d4c436","resolution":{"observed_at":"2026-08-06T05:53:52.751646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.753963Z","title":"Scaling search-augmented llm reasoning via adaptive information control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.753963Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:4253240af28b98d9512e8c6f507ef66140eca56b43bc81ad7f9f8f495e03c036","observation_id":"51a9fe03-06bf-4c44-97a5-a18e719450d7","resolution":{"observed_at":"2026-08-06T05:53:52.753963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.756198Z","title":"Wei Xiong, Chenlu Ye, Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian, Nan Jiang, and Tong Zhang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.756198Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:3e7ebfb523f3f49b78922774d99aa454b4d44dc21ebed12501e4c2ad211ae7aa","observation_id":"f92a6c1b-c9bd-48bf-adf1-9cb27978882d","resolution":{"observed_at":"2026-08-06T05:53:52.756198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.760835Z","title":"Llms4all: A review of large language models across academic disciplines.arXiv preprint arXiv:2509.19580,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.760835Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:2a70552b1cbac5595fbc14cf6b8d998ebda31376790b6c62473716400edacc76","observation_id":"4ce64937-e1b1-4807-9fe5-06d152e115f9","resolution":{"observed_at":"2026-08-06T05:53:52.760835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"cited_work":{"arxiv_id":"2607.06223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.06223","snapshot_observed_at":"2026-08-06T05:53:52.854862Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","venue":"cs.AI","work_id":"4ed45571-b256-481e-8d39-5f6d7a0885ce","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.763644Z"},"links":{"cited_paper":"/paper/2607.06223","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:64542a871c99875e092cf5fb4d446237248512445601a3d829e84e05a8e38e26","observation_id":"454f7f37-0091-4243-aba9-34b22322ce7d","resolution":{"observed_at":"2026-08-06T05:53:52.858284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21801","last_updated":"2026-05-20T22:59:02Z","snapshot_observed_at":"2026-07-31T22:43:35.705855Z","submitted_at":"2026-05-20T22:59:02Z","title":"Why Semantic Entropy Fails: Geometry-Aware and Calibrated Uncertainty for Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21801","snapshot_observed_at":"2026-08-06T05:53:52.766149Z","title":"Mapro: Recasting multi-agent prompt optimization as maximum a posteriori inference","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.766149Z"},"links":{"cited_paper":"/paper/2605.21801","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:1c5d9655a4d8937051a5e7bbda518962237d489e09f41edf7915dbf3440610d5","observation_id":"ae2f86d9-a61b-4345-84a8-11d2420ec17a","resolution":{"observed_at":"2026-08-06T05:53:52.766149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-06T05:53:52.768850Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.768850Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:e2fbccdcb627282380fe61ae9e47b4f706563f29a5132f13b8db1da4417c981c","observation_id":"8114cd00-53cd-4efb-baa9-9557b6121c75","resolution":{"observed_at":"2026-08-06T05:53:52.768850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11119","last_updated":"2026-06-09T17:16:03Z","snapshot_observed_at":"2026-07-31T16:22:30.560541Z","submitted_at":"2026-06-09T17:16:03Z","title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.11119","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11119","snapshot_observed_at":"2026-08-06T05:53:52.823547Z","title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","venue":"cs.LG","work_id":"aa9214a7-f665-445b-9f36-cd9c3ffeb9d2","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.771316Z"},"links":{"cited_paper":"/paper/2606.11119","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:52949674b7a60b064491c48bff7dd4439bf340e6084b65c9f3a554f9cd77f71e","observation_id":"c837d4d8-8b63-4426-836d-dc3c6a75e150","resolution":{"observed_at":"2026-08-06T05:53:52.828977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.492529Z","title":"APPENDIXCONTENTTABLE A Related Work 14 B Implementation Details and Additional Experiments 14 B.1 Benchmarks","venue":null,"work_id":"c8383f07-5a33-472c-935a-aeb3fd70fc1a","year":2025},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.773876Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:9a3fce4d949918ece01e28b8beb0fbd791322f587047952cea79751f31fbf844","observation_id":"6285bcc4-50ff-498e-ba5a-b8f4509aca7d","resolution":{"observed_at":"2026-08-06T05:53:54.495684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.482945Z","title":"While effective, these methods rely on final outcomes and thus overlook where uncertainty arises within multi-step reasoning","venue":null,"work_id":"4777d4b7-824e-4477-a068-c802693063b4","year":2025},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.776392Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:7023e20bce2ac951143f41fd2daaa7f783c3784535fd7008c021d5d74699f56a","observation_id":"98c29281-dc7e-47d9-bd71-bd471f03e792","resolution":{"observed_at":"2026-08-06T05:53:54.486208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.473066Z","title":"IGRPO (Zhang et al., 2026a) instead expands trajectory trees according to information gain and derives an induced teacher distribution for policy optimization","venue":null,"work_id":"7d3a924d-de6e-40d3-8b9a-ecf78f9fd3a5","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.778805Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:d588e18f67690d8c8db4274b6c3584df648520093a7a74bc906320b995c90536","observation_id":"179f783e-53a7-48e4-a01b-05041af08e16","resolution":{"observed_at":"2026-08-06T05:53:54.476587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.462444Z","title":"The agent interacts with the environment through search, page navigation, item inspection, and purchase decisions","venue":null,"work_id":"2f205fa4-0796-435d-8210-68a8f6e06f96","year":2024},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.781308Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:3e0de1ede21e8da584c569d8b4633e6680b2af55837c5d7f8117326dc5961e6c","observation_id":"5579dc2f-5b03-407a-aa6f-6c999df98cb7","resolution":{"observed_at":"2026-08-06T05:53:54.466251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.451338Z","title":"1 n nX i=1 Acent i 2 # = n−1 n σ2 R,E","venue":null,"work_id":"7ab8278b-bae8-44d5-9280-0f56c20ecee5","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.784060Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:61e6093b9a6a84a427870929a9fd3ec1f9ee735b4432756f7a2a16dcda690571","observation_id":"f2e637b2-b2c6-4298-b857-8367df30363e","resolution":{"observed_at":"2026-08-06T05:53:54.455291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.441469Z","title":"VIP provides a complementary gradient-level justification: under standard conditional i.i.d","venue":null,"work_id":"9c6bf05d-806f-4437-91c2-a4240793f7ed","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.786798Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:ee884325f21155a24720e1e904daa9a5f1d544052eb2ae2b16d47a41f69b9130","observation_id":"7821f00e-40cf-4b90-87a1-756e48fedc62","resolution":{"observed_at":"2026-08-06T05:53:54.444522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.423113Z","title":"The variation-budget literature motivates modeling policy-induced non-stationarity through the drift term DT (Besbes et al., 2014; 2015)","venue":null,"work_id":"68151bb8-4b79-4665-b98e-63aa427a8688","year":2014},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.791729Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:9ba460abba45f57c76194450f7c46458e9be7716a82254b7e1f79ce56f568e2e","observation_id":"a362d1fe-9974-4424-9999-0d0a8dc5fddb","resolution":{"observed_at":"2026-08-06T05:53:54.426106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.413379Z","title":"42\" rather than","venue":null,"work_id":"44a11baa-e1e2-46a2-aea4-9969f3b9d47d","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.794154Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:1bf66fafda7e3d02ed1a333f2dd6fbaa1d282d67fb2f7564dcbd1d03211d84ed","observation_id":"bfbe4bae-8ba9-4e69-84e3-2c9c2da9f545","resolution":{"observed_at":"2026-08-06T05:53:54.416795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.401997Z","title":"name\":\"sql_query","venue":null,"work_id":"b82fc61a-1934-4a8a-9f35-9479e0f05c14","year":2015},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.797095Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:342d5ff66884bc7dd998e5ae07f90ebe20eb75f2eb6bd31bdd2e262116df4687","observation_id":"b3529ecf-c5f6-4dd1-9817-c09442526626","resolution":{"observed_at":"2026-08-06T05:53:54.405902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.502127Z","title":"Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu, Xuanyu Lei, Hanyu Lai, Yu Gu, Hangliang Ding, Kaiwen Men, Kejuan Yang, et al","venue":null,"work_id":"a515b446-e073-4fe1-82b7-6ac931ec2d29","year":2024},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.733801Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:0eb6a4a91576736f5d2a6f126b4df929f341fd3dc62de3efa1a07a3d2149c147","observation_id":"ed38e50f-78f7-4050-ac0c-0ba23b2eb645","resolution":{"observed_at":"2026-08-06T05:53:54.505043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09961","last_updated":"2026-06-08T14:26:05Z","snapshot_observed_at":"2026-08-09T01:39:00.719497Z","submitted_at":"2026-06-08T14:26:05Z","title":"3SPO: State-Score-Supervised Policy Optimization for LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09961","snapshot_observed_at":"2026-08-06T05:53:52.723284Z","title":"3SPO: State-score-supervised policy optimization for llm agents.arXiv preprint arXiv:2606.09961,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.723284Z"},"links":{"cited_paper":"/paper/2606.09961","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:36d7c93f4156111562d2028717fa6e362e4a81dec56fccd8981f9e12029db3d3","observation_id":"b4b3596d-a445-4a55-a7dc-1030a185020b","resolution":{"observed_at":"2026-08-06T05:53:52.723284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.11779","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:54.330842Z","title":"Temperature as a meta-policy: Adaptive temperature in llm reinforcement learning.arXiv preprint arXiv:2602.11779,","venue":null,"work_id":"ff878f41-7180-4bae-a1d1-f00104db4c25","year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.714502Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:827f2c99f37a8c5ae188b8cd13e69e7117595870fc8ad5cd1312ec59b6dfffda","observation_id":"e5835ec8-5613-4908-abb1-6a43d8d84e55","resolution":{"observed_at":"2026-08-06T05:53:54.335868Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.758401Z","title":"Coba-rl: Capability-oriented budget allocation for reinforcement learning in llms.arXiv preprint arXiv:2602.03048,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.758401Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:edf5efd7ceff49473f38b486f57d4ef315ef29f9b15670f77813bbca61c017a3","observation_id":"36e3614f-6bda-4940-aed6-f89bc3d6f519","resolution":{"observed_at":"2026-08-06T05:53:52.758401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T05:53:52.744072Z","title":"Deepseekmath: Pushing the limits of mathemat- ical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.744072Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:efee82c1f5d2df4d6b0a5677963dad192690862fcb3412d3eb732dfda00fdb28","observation_id":"edb736c8-4c8a-407f-a756-b069625ef69e","resolution":{"observed_at":"2026-08-06T05:53:52.744072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.711539Z","title":"Finite-time analysis of the multiarmed bandit problem.Machine learning, 47(2):235–256, 2002a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.711539Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:83f0ec8a6de7da355a9b41e9f2e2c35f0ce6580be032ae8755c893253ec9b447","observation_id":"e6b3308e-4fc6-48d8-8f73-733b20fd7814","resolution":{"observed_at":"2026-08-06T05:53:52.711539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.19208","last_updated":"2026-04-23T16:56:38Z","snapshot_observed_at":"2026-07-06T22:46:40.118923Z","submitted_at":"2026-02-22T14:38:24Z","title":"How to Allocate, How to Learn? Dynamic Rollout Allocation and Advantage Modulation for Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.19208","snapshot_observed_at":"2026-08-06T05:53:52.720367Z","title":"How to allocate, how to learn? dynamic rollout allocation and advantage modulation for policy optimization.arXiv preprint arXiv:2602.19208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.720367Z"},"links":{"cited_paper":"/paper/2602.19208","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:8f447e49fa8102f926776fe535e4efbc5874451a8c0e4a031263a68276ea1687","observation_id":"4ef582f9-9263-4486-b582-b33393401d0b","resolution":{"observed_at":"2026-08-06T05:53:52.720367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:53:52.717527Z","title":"Agentic entropy-balanced policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.717527Z"},"links":{"citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:59b25eda91fef77ab2202ca1b8714575d3f739aa93e9a82356b397ec2deae9bd","observation_id":"a96c60cf-83ce-48c8-a059-c68faa26629b","resolution":{"observed_at":"2026-08-06T05:53:52.717527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T02:46:02.847299Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":4,"verified_fuzzy":11},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2608.05080."}