{"as_of":"2026-08-16T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c28fbc48d6c089c16884ce51d4f80a8499901853bb1d2fab459e06657e849dbb","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T13:01:45.049174Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:53:52.763644Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:53:52.854862Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06223","snapshot_observed_at":"2026-08-04T13:44:42.254343Z","title":"arXiv preprint arXiv:2607.06223 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-13T06:02:04.863233Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:42.254343Z"},"links":{"cited_paper":"/paper/2607.06223","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:c435fe80f13cca47f98387a6436ae48f69193ce43505a1febe132325643e4839","observation_id":"601c01fc-f827-46be-80ab-f4ef28a8bd95","resolution":{"observed_at":"2026-08-04T13:44:42.254343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"cited_work":{"arxiv_id":"2607.06223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.06223","snapshot_observed_at":"2026-08-06T05:53:52.854862Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","venue":"cs.AI","work_id":"4ed45571-b256-481e-8d39-5f6d7a0885ce","year":2026},"citing_paper":{"arxiv_id":"2608.05080","last_updated":"2026-08-05T17:22:02Z","snapshot_observed_at":"2026-08-14T14:09:06.311070Z","submitted_at":"2026-08-05T17:22:02Z","title":"Optimizing What Policies Learn From: Recoverability-aware Rollout Intervention Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:53:52.763644Z"},"links":{"cited_paper":"/paper/2607.06223","citing_paper":"/paper/2608.05080"},"observation_digest":"sha256:942a7e700bf4dcb2dae5dc010ecec043f31d15090ebb6c7a927b36a299d5e5ba","observation_id":"454f7f37-0091-4243-aba9-34b22322ce7d","resolution":{"observed_at":"2026-08-06T05:53:52.858284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.06223/citation-record","integrity":"/paper/2607.06223/integrity","json":"/paper/2607.06223/citation-record.json","paper":"/paper/2607.06223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.059598Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":"3b714b71-fd6e-4be0-85b2-b819da87c44f","year":1901},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:e903f10e7cf955c07b6fbc651653784843cb56c2f2337cc7282e5b05a42db092","observation_id":"653bad21-17df-4070-bd47-d3474750dee1","resolution":{"observed_at":"2026-07-08T13:04:57.061259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:25:13.143518Z","title":"Palm: Scaling language modeling with pathways.Journal of machine learning research, 24(240): 1–113, 2023","venue":null,"work_id":"cc4b45b8-ca25-4606-88e6-6573b0f8b3b4","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:214962aa3f3ce2eb365aab81401730b40afd1e4bab816491e01c638067ea9d4f","observation_id":"32b1664c-bd0d-4432-91aa-a452b6374cef","resolution":{"observed_at":"2026-07-08T13:04:57.083108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:7f3ed9baee7d0e46adc4df69d2cfa856316367857deba8fa846c98e79c301c79","observation_id":"f1d3c3ec-21cd-4711-8191-2f83006a4011","resolution":{"observed_at":"2026-07-08T13:04:56.738338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:cd51c1f04379d878ea9f5e99b7716f863aa5e1d069212e8efd7eed27adca70b3","observation_id":"eecfc933-8c46-4f11-83ac-80370982ca02","resolution":{"observed_at":"2026-07-08T13:04:56.701696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.615980Z","title":"Toolformer: Language models can teach themselves to use tools.Advances in neural information processing systems, 36: 68539–68551","venue":null,"work_id":"b18d1b4f-f40e-4afe-aaf9-d74b9349d25e","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:1f4bd617f6d1f2d8feafaa0a773e19d019e69d1cb7d6aa15a2101bc4650461cd","observation_id":"6eb9376e-9dd2-4705-9c20-335efced767d","resolution":{"observed_at":"2026-07-08T13:04:57.094150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:9be05a701617a8aa28cd70a8890e47241d83da6f5125119be74d73b84542131a","observation_id":"59fbeac2-527b-467f-85be-ae71a3a1a923","resolution":{"observed_at":"2026-07-08T13:04:56.742129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-15T20:12:18.032530Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"cited_work":{"arxiv_id":"2506.18096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.18096","snapshot_observed_at":"2026-07-08T13:04:56.715325Z","title":"Deep Research Agents: A Systematic Examination And Roadmap, September 2025","venue":"cs.AI","work_id":"ac5cfd30-9bde-4b94-9dd3-65ec5ef6056b","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2506.18096","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:24daf3b946b1b2362c2a8cc2dcc59419439d0efc6ad9513a0df5cc8d61616649","observation_id":"1a918ce6-6f2d-4f62-853f-055961e0244e","resolution":{"observed_at":"2026-07-08T13:04:56.716778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.090614Z","title":"Searching for best practices in retrieval- augmented generation","venue":null,"work_id":"b57ee23f-8efd-4964-8879-e6ea6f6b0f52","year":2024},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:773b2a4fb46bf095f97cdd47663230500f797f51511d69804283ee83cc3c7e51","observation_id":"3555b2ba-7936-4a1e-b79c-7e9d3df39f71","resolution":{"observed_at":"2026-07-08T13:04:57.091978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.094889Z","title":"Search-o1: Agentic search-enhanced large reasoning models","venue":null,"work_id":"0c3cf575-e9bb-46c5-81b2-b8b834322cd5","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:199aceb6c6f364c4766fa2da9c7dc9dde42326a567d808289f23a5eeae5343bd","observation_id":"b38c324e-277e-4cc6-846a-2aab5023bafa","resolution":{"observed_at":"2026-07-08T13:04:57.096554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.09516","doi":"10.48550/arxiv.2503.09516","metadata_source":"pith","pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","venue":"cs.CL","work_id":"0e0b7549-2bc4-4574-aa7f-588ffa16eaae","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:9f97844edb62b9ef4a4a6387b6d0d80e26a10bc976913c8480ca2018b185cb23","observation_id":"6d71ee68-0fae-4634-be81-d148ace315d6","resolution":{"observed_at":"2026-07-08T13:04:56.721618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:3edeb81f8a9d615d10d92a547b65e38cfd0e19df0b32379da0d049f14aa1407e","observation_id":"cc264f8a-82bf-408a-8192-331fc975c8ec","resolution":{"observed_at":"2026-07-08T13:04:56.719157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:f295b87155c7682ed98215b1ae5c961065eed7e8473ab3a69e6cff4884476f35","observation_id":"8f58128f-f53e-43de-9396-3f476fc3f513","resolution":{"observed_at":"2026-07-08T13:04:56.711606Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:16:26.555721Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744","venue":null,"work_id":"aa3e2ba7-4265-495b-8612-615b2ddc9991","year":2022},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:c0372eaba8b2123d277a551e3ed3db1dc1d6083355aef58212ca44642df3ae2d","observation_id":"ea69393f-50df-47b8-9222-cda18a03251d","resolution":{"observed_at":"2026-07-08T13:04:57.085272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:6114cca2b98ec50010631b1a832de2d4a1cd92ec68c55a964878faafc975b2eb","observation_id":"5db26127-3237-46a2-8a55-3a47aa4ea8f9","resolution":{"observed_at":"2026-07-08T13:04:56.723999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"cited_work":{"arxiv_id":"2505.10978","doi":"10.48550/arxiv.2505.10978","metadata_source":"pith","pith_arxiv_id":"2505.10978","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","venue":"cs.LG","work_id":"bc65d492-e6ba-4522-874c-43d2f4fc5191","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2505.10978","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:f81dcd3e50a42c9e81e3e52a1dc9e6f79c36b81d96bc4bef29f6eb9e29e7b4fb","observation_id":"924d65f0-371c-4ed0-9a18-57c48f7c031f","resolution":{"observed_at":"2026-07-08T13:04:56.714142Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:36.769512Z","title":"Information gain-based policy optimization: A simple and effective approach for multi-turn llm agents","venue":null,"work_id":"c61c2301-5e65-4715-ac09-dcc479c633ad","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:63a23d5221b33b11a416cf9efb7edede5139478afe27ee3a008020a6d9671d41","observation_id":"5517b29e-903c-4223-89a1-f84079b4f418","resolution":{"observed_at":"2026-07-08T13:04:56.696136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21240","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:56.743354Z","title":"Tree search for llm agent reinforcement learning","venue":null,"work_id":"69c0b47c-2fb7-417a-8ff3-444cc4a56703","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:da2f0f2580a7930739e4778ccf8f9bb903d38186f222f0e405b7f42a406dcca4","observation_id":"957ff1d1-e873-46b1-b8d2-06258fc57d2f","resolution":{"observed_at":"2026-07-08T13:04:56.744901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14545","doi":"10.48550/arxiv.2510.14545","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic entropy-balanced policy optimization","venue":"arXiv (Cornell University)","work_id":"da44e859-fbd4-479a-9523-0b6f798ebc23","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:86f2c440d2db75f4f127df4305d1ed949a331786e032bc2f0ee07407abbab036","observation_id":"f41b96ba-06e1-48cb-af03-3eb52abc5429","resolution":{"observed_at":"2026-07-08T13:04:56.704280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:6b87d41a6f14f0051484a662c8dc555b034dd5a8a137fc42936182e0cc038d84","observation_id":"746a0598-b11f-487d-9302-53595c7fd4f5","resolution":{"observed_at":"2026-07-08T13:04:56.709206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.086056Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"f42c8e62-7c0d-4824-b1a2-906653781f5c","year":2024},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:1250e8948b9b0778c677085f746b22c8814059a1257bdae3d4efeb1b72f87810","observation_id":"533705bc-d6b6-4971-afa2-0eb313595668","resolution":{"observed_at":"2026-07-08T13:04:57.087498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:201716ebf3b15170f6ee5d9e4147cc3a296ac8e0d2c99193e1fc4349a1ae7384","observation_id":"1ace522c-3a58-4e76-a26b-5012f4e794d6","resolution":{"observed_at":"2026-07-08T13:04:56.735738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:1a8547f3786ec9db296853319402840a48c0dcb2d390389fa6adc136cf3c1d38","observation_id":"c40d23b7-eece-4928-99e9-19d3e0d190cf","resolution":{"observed_at":"2026-07-08T13:04:56.706723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04588","last_updated":"2026-05-19T11:51:42Z","snapshot_observed_at":"2026-08-04T18:36:41.979541Z","submitted_at":"2025-05-07T17:30:22Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","version":3},"cited_work":{"arxiv_id":"2505.04588","doi":"10.48550/arxiv.2505.04588","metadata_source":"pith","pith_arxiv_id":"2505.04588","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ZeroSearch: Incentivize the Search Capability of LLMs without Searching","venue":"cs.CL","work_id":"0ea11521-4603-4e7a-abe3-bbc2f3e3f71c","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2505.04588","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:89c8e17f0f26f5402dc63eb5ccaf7da02e01239b4aabd6283a7a6ac8b4480243","observation_id":"76a4e2d2-bb8f-4746-9e5b-1a996670f524","resolution":{"observed_at":"2026-07-08T13:04:56.726732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.05592","doi":"10.48550/arxiv.2503.05592","metadata_source":"pith","pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","venue":"cs.AI","work_id":"f5ed73d2-f2ff-4cf6-853d-3586333e44ef","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:d0564215f6b120ed1c6b5d3afba74680bc71816ea7528d44bb3d748d16c92897","observation_id":"fbd51867-5c1e-427a-970d-6080a2d3ed18","resolution":{"observed_at":"2026-07-08T13:04:56.732119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.072620Z","title":"Smart-searcher: Incentivizing the dynamic knowledge acquisition of llms via reinforcement learning","venue":null,"work_id":"c5de9ca1-7e7e-43df-93d9-40ecc9ab7755","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:782bd8e849caf63d0fb3e22118c46883c2de8ba30cff55154ea09e9bffce68b6","observation_id":"40f437aa-3049-4bf9-8921-3c39e18ee3c7","resolution":{"observed_at":"2026-07-08T13:04:57.073965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15107","last_updated":"2025-05-26T04:44:21Z","snapshot_observed_at":"2026-08-16T11:26:30.047401Z","submitted_at":"2025-05-21T05:01:31Z","title":"StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2505.15107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15107","snapshot_observed_at":"2026-07-08T13:04:56.727934Z","title":"Stepsearch: Igniting llms search ability via step-wise proximal policy optimization.arXiv preprint arXiv:2505.15107","venue":"cs.CL","work_id":"0c9eadf8-223b-4c81-a25c-3a46d830ba8b","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2505.15107","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:85e735e048f0a3f90e3f76e77c8381039eb2b2b548fbb1eaa895d01faaa1a9ff","observation_id":"733fe686-4d61-4648-8494-88de7018c776","resolution":{"observed_at":"2026-07-08T13:04:56.729725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-08-14T09:16:00.399049Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.19849","doi":"10.48550/arxiv.2507.19849","metadata_source":"pith","pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Reinforced Policy Optimization","venue":"cs.LG","work_id":"6cb0d241-5e4d-44ed-9476-659819ec0681","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:2c61929b94c6fee8f1b7040837dae22afd3f6ad2af8d3bc4f5ed58a1ebcf0e23","observation_id":"9641d324-553f-4063-8ade-d0947055e109","resolution":{"observed_at":"2026-07-08T13:04:56.693393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:16:21.116017Z","title":"Natural questions: a benchmark for question answering research.Transactions of the Association for Computational Linguistics, 7:453–466","venue":null,"work_id":"36c00860-e248-432b-864c-9ff0740d4ac0","year":2019},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:d5457d4a0ae145c63b5c00a517dcda30479452f07edb8f8490416fb2d5ad1567","observation_id":"b46cd4e0-7718-4392-829a-35b24d6e2297","resolution":{"observed_at":"2026-07-08T13:04:57.089868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.074726Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":"8b4499bc-7412-4fd2-83d6-28182ece7f00","year":2017},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:9b23f045e7e4a6a054d1b2f903db976b53f1c6c5ff3816023cb6491ef7b6e1d8","observation_id":"7a7ae40f-1efd-4503-abf7-7c5332196998","resolution":{"observed_at":"2026-07-08T13:04:57.076213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:36:22.357163Z","title":"When not to trust language models: Investigating effectiveness of parametric and non-parametric memories","venue":null,"work_id":"c7c8ca77-f0f4-41c3-b800-889503dd497f","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:5374bb446f001c7d1a0d9e9f1805fbf42ad139ec254388bbe5bf7d5f9d5cf94f","observation_id":"71e13e9f-c272-4e1e-a83f-32eee4a60b52","resolution":{"observed_at":"2026-07-08T13:04:57.081101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.070545Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":"9fa645a0-3bf0-4986-aba9-dff1f0dfb78b","year":2018},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:670708e3348380c528c58686298895f24ddf4666c37d1b948107620eb8f3de10","observation_id":"588a4f76-4c1f-496c-8435-803fdfe81971","resolution":{"observed_at":"2026-07-08T13:04:57.072005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.068389Z","title":"Constructing a multi-hop qa dataset for comprehensive evaluation of reasoning steps","venue":null,"work_id":"fd2bf568-cbd2-407a-a17c-0d9f01efdd9c","year":2020},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:f1576667b8d04321a22df3f0316140f6b2d6a354891e7d0ee219365eb597870a","observation_id":"ca273a76-9e6c-4df2-abef-9dd2c4417ae1","resolution":{"observed_at":"2026-07-08T13:04:57.069900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:16:21.060214Z","title":"Musique: Multihop questions via single-hop question composition.Transactions of the Association for Computational Linguistics, 10:539–554","venue":null,"work_id":"c8d66a44-9695-4211-998e-a85a97efa16e","year":2022},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:606c87b0274206b1e78c24d82d2533fe17e2f96b6485e5379580373b95396d6c","observation_id":"d7a05ff2-e2b9-45ef-bf4f-34290dfa4c1b","resolution":{"observed_at":"2026-07-08T13:04:57.063647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.064523Z","title":"Measuring and narrowing the compositionality gap in language models","venue":null,"work_id":"997bfd0b-443c-4ff9-8c1a-1ae7bb3b6962","year":2023},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:afc40c4dbb4277324721e4b3bea80ed76b52b3efb956c237cba5811273ee3104","observation_id":"95cbde69-9b32-4dbe-af78-721da3d53d77","resolution":{"observed_at":"2026-07-08T13:04:57.066034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.066611Z","title":null,"venue":null,"work_id":"5367b59e-43c6-4ca3-84fa-fcc5e6a40037","year":2024},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:cc88fafa09425bdb227a566cb33f363b986f338a2c16d877199a6701834a1172","observation_id":"e92f7f51-20c9-40bc-81e6-3d8406a88775","resolution":{"observed_at":"2026-07-08T13:04:57.067705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":"2212.03533","doi":"10.48550/arxiv.2212.03533","metadata_source":"pith","pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","venue":"cs.CL","work_id":"789cc674-467e-4f23-bb50-05c79fe8c4c2","year":2022},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:67e5f249cc4af5f635dd8b5274b66e6f79a05a26d20e91a5a602721da7edb394","observation_id":"76e253ca-14b7-44a0-ab5e-51ed8aa1c835","resolution":{"observed_at":"2026-07-08T13:04:56.699304Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:09.486841+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.076950Z","title":"Asymptotic evaluation of certain markov process expectations for large time, i.Communications on pure and applied mathematics, 28 (1):1–47, 1975","venue":null,"work_id":"8182af5a-bc26-442c-bdce-640b0a806100","year":1975},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:5d6544bbd075e591ffcd3e039b0fb0abfb13da4618f588d5784ec8df129fd2d0","observation_id":"7b48ea87-c656-4864-8393-c46097a58a1b","resolution":{"observed_at":"2026-07-08T13:04:57.079064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T05:40:09.891709Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":16},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2607.06223."}