{"as_of":"2026-08-18T08:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20147970a4d1a6039aa16dbc8fed93593ee910a15d8fe9cba9f18b6c6be01e32","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:26:55.346259Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:51:43.200350Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T00:55:12.126083Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-07T00:22:18.164811Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14345","last_updated":"2025-06-17T09:38:45Z","snapshot_observed_at":"2026-08-13T04:00:57.374755Z","submitted_at":"2025-06-17T09:38:45Z","title":"A Vision for Geo-Temporal Deep Research Systems: Towards Comprehensive, Transparent, and Reproducible Geo-Temporal Information Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:22:18.164811Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2506.14345"},"observation_digest":"sha256:895a94b9e5ffdb5be8b2d03a9253e06ad0431eede4b9cc6c183751fdf257be0b","observation_id":"38b539da-c53c-43a2-8365-fcfcebcd6817","resolution":{"observed_at":"2026-08-07T00:22:18.164811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-06T10:17:13.579736Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00271","last_updated":"2025-09-01T02:48:41Z","snapshot_observed_at":"2026-08-15T01:13:05.540704Z","submitted_at":"2025-08-01T02:30:32Z","title":"MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T10:17:13.579736Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2508.00271"},"observation_digest":"sha256:7fc45bf86af3806b94d5f01da142ef8f585ee2b6b2867a323a4003e7772acfd6","observation_id":"d87aa6c1-0808-4f41-9a4d-e7235a8a94d3","resolution":{"observed_at":"2026-08-06T10:17:13.579736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-05T22:46:12.625929Z","title":"Arik, and Jiawei Han","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06600","last_updated":"2025-08-08T17:55:11Z","snapshot_observed_at":"2026-08-16T19:56:18.562519Z","submitted_at":"2025-08-08T17:55:11Z","title":"BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:46:12.625929Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2508.06600"},"observation_digest":"sha256:58a4816e5561015f1595790c505d982249db9704a9a1e7db90df7f3c4be02b40","observation_id":"11891e05-7f2a-46ad-a05b-74e367e31854","resolution":{"observed_at":"2026-08-05T22:46:12.625929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-05T20:17:09.393341Z","title":"Arik, and Jiawei Han","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10874","last_updated":"2025-08-14T17:46:01Z","snapshot_observed_at":"2026-08-06T03:19:32.559275Z","submitted_at":"2025-08-14T17:46:01Z","title":"SSRL: Self-Search Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:17:09.393341Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2508.10874"},"observation_digest":"sha256:4b6c19b252ccb601af34e1313065a684a753c8e8e6be1b6754cade3a842b629a","observation_id":"3e06a672-a89a-4390-a2df-320dc727fe33","resolution":{"observed_at":"2026-08-05T20:17:09.393341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-15T16:08:39.097595Z","title":"Arik, and Jiawei Han","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-15T23:25:21.613036Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:08:39.097595Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2509.08755"},"observation_digest":"sha256:47cf7e432a9b6b30e5dd66dfa95103e812fded525a6a98f816fe1544b897e9f7","observation_id":"6252f0a3-8341-473e-9c5e-a6ab0203c525","resolution":{"observed_at":"2026-08-15T16:08:39.097595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.15117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-07-01T00:55:12.126083Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents","venue":null,"work_id":"7637d87e-ae91-40d6-a208-921791b92408","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":244,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:f300a72bbe434b92fbf1415e0fce16bd83b91e4d9f25a3d7a82c3ecb65edfba1","observation_id":"9b1aa506-a3b4-4efe-be0a-52109793cfd1","resolution":{"observed_at":"2026-05-18T00:02:24.586905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.15117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-07-01T00:55:12.126083Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents","venue":null,"work_id":"7637d87e-ae91-40d6-a208-921791b92408","year":2025},"citing_paper":{"arxiv_id":"2510.00861","last_updated":"2026-04-20T08:17:44Z","snapshot_observed_at":"2026-08-11T07:29:40.321860Z","submitted_at":"2025-10-01T13:10:36Z","title":"Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T11:06:20.058342Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2510.00861"},"observation_digest":"sha256:8417cdf177a94aeea1d84e9d819f188de15519c020a8ae7570fd6eb3370162ca","observation_id":"0fcab628-5b5b-4eea-af6c-c1a9c9c9a03d","resolution":{"observed_at":"2026-05-18T11:11:18.283961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-04T09:50:45.763606Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13272","last_updated":"2026-06-03T06:16:13Z","snapshot_observed_at":"2026-08-15T12:17:18.554444Z","submitted_at":"2025-10-15T08:17:52Z","title":"Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T09:50:45.763606Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2510.13272"},"observation_digest":"sha256:b948d6da01c58b3bea683112fda9a36e72d2d58ae1977247d4dce122773265cf","observation_id":"6118e055-e4d6-4a0d-a75a-e3427ebcc2c3","resolution":{"observed_at":"2026-08-04T09:50:45.763606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-04T08:48:40.941733Z","title":"Arik, and Jiawei Han","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18939","last_updated":"2026-07-14T02:30:28Z","snapshot_observed_at":"2026-08-13T23:50:37.737578Z","submitted_at":"2025-10-21T17:58:45Z","title":"Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T08:48:40.941733Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2510.18939"},"observation_digest":"sha256:2707368fccad37bd529cb75033640cb13d7694c1493d9e22adcb09579a477332","observation_id":"785a30ee-2b24-48a5-af96-a455692b9848","resolution":{"observed_at":"2026-08-04T08:48:40.941733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-03T23:33:45.833809Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05385","last_updated":"2026-07-23T06:36:18Z","snapshot_observed_at":"2026-08-17T14:05:47.398482Z","submitted_at":"2025-11-07T16:08:34Z","title":"TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:45.833809Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2511.05385"},"observation_digest":"sha256:e18856392c330088f855cb098eeebd8c2edf2e47bc87c73ed6a1e92da93363f7","observation_id":"85761933-03a2-4669-961f-021236f6c4fc","resolution":{"observed_at":"2026-08-03T23:33:45.833809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-03T17:53:54.804421Z","title":"O., and Han, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.07795","last_updated":"2026-05-30T17:04:27Z","snapshot_observed_at":"2026-08-15T09:08:17.333981Z","submitted_at":"2025-12-08T18:26:58Z","title":"ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T17:53:54.804421Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2512.07795"},"observation_digest":"sha256:4a67225502f6a5b339c8f45e8c54edfa9f03ef3d9964aa5c7098e225499b7e7b","observation_id":"f189d6d9-658d-4f1c-98a6-3b1e506dc583","resolution":{"observed_at":"2026-08-03T17:53:54.804421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.15117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-07-01T00:55:12.126083Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents","venue":null,"work_id":"7637d87e-ae91-40d6-a208-921791b92408","year":2025},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-08-11T06:12:59.324541Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T15:08:53.731480Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:14e4947685461f39e52ad06f38ce9c435f3ac0824748a0605417879feb872e3a","observation_id":"7cb12523-4345-4d84-a68f-d2958bf61d59","resolution":{"observed_at":"2026-05-11T16:46:06.919257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.15117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-07-01T00:55:12.126083Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents","venue":null,"work_id":"7637d87e-ae91-40d6-a208-921791b92408","year":2025},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-08-11T06:12:59.324541Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-01T00:48:54.797750Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:e58b48861439cca23cf8876e0ea4be8849b2f41f84b66437ec1b298e99a76d75","observation_id":"600bc524-c3a1-494f-99ec-69a625a52d40","resolution":{"observed_at":"2026-07-01T00:55:12.127996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.15117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-07-01T00:55:12.126083Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents","venue":null,"work_id":"7637d87e-ae91-40d6-a208-921791b92408","year":2025},"citing_paper":{"arxiv_id":"2605.01399","last_updated":"2026-05-02T11:43:23Z","snapshot_observed_at":"2026-08-12T12:36:45.621839Z","submitted_at":"2026-05-02T11:43:23Z","title":"Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-09T14:40:23.170932Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2605.01399"},"observation_digest":"sha256:b76539279bc307635b5c0cf3c66e6482814c90f5963e454c9fb38571a8d54b66","observation_id":"d8193e3d-2d96-468a-b0f0-524b0649de2b","resolution":{"observed_at":"2026-05-11T16:51:08.796266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.15117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-07-01T00:55:12.126083Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents","venue":null,"work_id":"7637d87e-ae91-40d6-a208-921791b92408","year":2025},"citing_paper":{"arxiv_id":"2605.06285","last_updated":"2026-05-07T13:56:13Z","snapshot_observed_at":"2026-08-13T21:32:42.386381Z","submitted_at":"2026-05-07T13:56:13Z","title":"LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T10:27:00.257353Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2605.06285"},"observation_digest":"sha256:5f3c91ecc8c16ccb62ce10f590a3a4ad473b594c78332344894f77920d9b0438","observation_id":"e03c2656-8aee-4852-8bbf-20f7a3d434a2","resolution":{"observed_at":"2026-05-11T20:01:12.045981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.15117","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-07-01T00:55:12.126083Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents","venue":null,"work_id":"7637d87e-ae91-40d6-a208-921791b92408","year":2025},"citing_paper":{"arxiv_id":"2606.26122","last_updated":"2026-05-27T21:21:42Z","snapshot_observed_at":"2026-08-15T22:31:05.444033Z","submitted_at":"2026-05-27T21:21:42Z","title":"DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T12:50:16.625077Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2606.26122"},"observation_digest":"sha256:545a97752f7776da8bca4022b2cbf4e160f0f58e9a6dfdc9641c66eb31a3166d","observation_id":"8fcae104-3086-451d-888d-490e03e36875","resolution":{"observed_at":"2026-06-29T12:53:26.519864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-02T03:10:51.532947Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13988","last_updated":"2026-07-15T16:16:42Z","snapshot_observed_at":"2026-08-12T23:46:45.285278Z","submitted_at":"2026-07-15T16:16:42Z","title":"TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:10:51.532947Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2607.13988"},"observation_digest":"sha256:405c4872af22a7dd730341d16c8ae57b5a23de74682a14eab054be66168e223d","observation_id":"fe7c2143-8f14-4272-87fe-6dcc857aabba","resolution":{"observed_at":"2026-08-02T03:10:51.532947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-04T23:23:14.639942Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents.arXiv preprint arXiv:2505.15117, 2025a","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01667","last_updated":"2026-08-03T04:01:36Z","snapshot_observed_at":"2026-08-09T13:33:19.122605Z","submitted_at":"2026-08-03T04:01:36Z","title":"TCPO: Turn-Level Credit Policy Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T23:23:14.639942Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2608.01667"},"observation_digest":"sha256:a901c29ae61983205604ebd9ef84e0ae1ff6f9f34157f9dbe85eb198ff052e7e","observation_id":"3f450e9f-b910-4ae1-be33-eae85bac52ea","resolution":{"observed_at":"2026-08-04T23:23:14.639942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15117","snapshot_observed_at":"2026-08-15T23:51:43.200350Z","title":"An empirical study on reinforcement learning for reasoning-search interleaved llm agents.arXiv preprint arXiv:2505.15117, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12764","last_updated":"2026-08-13T03:13:18Z","snapshot_observed_at":"2026-08-17T18:26:23.307797Z","submitted_at":"2026-08-13T03:13:18Z","title":"Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:51:43.200350Z"},"links":{"cited_paper":"/paper/2505.15117","citing_paper":"/paper/2608.12764"},"observation_digest":"sha256:feefa9b70a266705e1a7ee6ed125e64c26a066c83207792768c797b967439931","observation_id":"bbcfe5a8-7c4d-4729-bd5c-0faf5bb04904","resolution":{"observed_at":"2026-08-15T23:51:43.200350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15117/citation-record","integrity":"/paper/2505.15117/integrity","json":"/paper/2505.15117/citation-record.json","paper":"/paper/2505.15117"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:26:49.226134Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.226134Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:fc7eb89a21a77863ba80da389318b779932f9f730a65028aa0aa1da25a87e8ca","observation_id":"a9c57f54-6a3f-411f-9cd5-c481acc54943","resolution":{"observed_at":"2026-08-07T15:26:49.226134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T15:26:49.330797Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.330797Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:eb186d7c039889c552a86c4e8d9ee2ec751d029b635f69125483801daa2569a7","observation_id":"4b28661e-4667-436f-ad52-9e167fd09ce4","resolution":{"observed_at":"2026-08-07T15:26:49.330797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:59.078920Z","title":"Self-rag: Learn- ing to retrieve, generate, and critique through self-reflection","venue":null,"work_id":"aaa58aed-a81e-4945-a705-46f41b1059fe","year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.410784Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:0bed18cf9a6e6a951ea21515922a633b045389c854acbb753747f7216d1fcfaf","observation_id":"1fbacb48-e9af-47ef-884b-eb32fcb592d5","resolution":{"observed_at":"2026-08-07T15:26:59.157980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19470","last_updated":"2025-09-23T03:45:42Z","snapshot_observed_at":"2026-08-17T01:02:33.957223Z","submitted_at":"2025-03-25T09:00:58Z","title":"ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19470","snapshot_observed_at":"2026-08-07T15:26:49.507040Z","title":"Research: Learning to reason with search for llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.507040Z"},"links":{"cited_paper":"/paper/2503.19470","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:dab89161ce1d3f6ff3e76c05ab23fb7c7be9ffcc8ea0a47394af36a517be0725","observation_id":"3c45f28c-547c-4ea1-a66b-c9457ded3b34","resolution":{"observed_at":"2026-08-07T15:26:49.507040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09190","last_updated":"2019-07-22T09:01:35Z","snapshot_observed_at":"2026-08-15T01:16:28.394234Z","submitted_at":"2019-07-22T09:01:35Z","title":"ELI5: Long Form Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.09190","snapshot_observed_at":"2026-08-07T15:26:49.595880Z","title":"Eli5: Long form question answering","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.595880Z"},"links":{"cited_paper":"/paper/1907.09190","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:70e660c43c0aa74bdaa989cdec58b9d68f52c98c213802346d7f570cf7caa252","observation_id":"4f6f5d45-770b-499d-a63b-ccc844135ad7","resolution":{"observed_at":"2026-08-07T15:26:49.595880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-07T15:26:49.679749Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.679749Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:326420ae49d3c50232952c9169f879f90a873f92992c98def53ebbab449e4456","observation_id":"7b898ac7-96ce-4443-a0e5-0a274b00fb5d","resolution":{"observed_at":"2026-08-07T15:26:49.679749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-07T15:26:49.769546Z","title":"Retrieval-augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.769546Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:a33d4db754c2497045d85129fedc8029d684044dfbd51045ed40e3698d37ec9f","observation_id":"56345dbc-a3ed-4a1c-bf4e-68a59f2c5470","resolution":{"observed_at":"2026-08-07T15:26:49.769546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08433","last_updated":"2023-10-12T15:56:24Z","snapshot_observed_at":"2026-08-16T14:52:39.111753Z","submitted_at":"2023-10-12T15:56:24Z","title":"A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08433","snapshot_observed_at":"2026-08-07T15:26:49.877999Z","title":"A confederacy of models: A comprehensive evaluation of llms on creative writing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.877999Z"},"links":{"cited_paper":"/paper/2310.08433","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:249cc6aa6ebe33886ee9052beaa6d12e22f517535445f8fc1bba9025bc668055","observation_id":"a9547765-daaf-4d6a-b000-24d7e114b491","resolution":{"observed_at":"2026-08-07T15:26:49.877999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:26:49.967806Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:49.967806Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:02bb3d56b81a854924ee3da470d0af31d02047ef5ad70eaf2db7fc3a4d94c064","observation_id":"585497cc-a9c9-4f4b-81bb-fa58ff551145","resolution":{"observed_at":"2026-08-07T15:26:49.967806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-07T15:26:50.082149Z","title":"Training compute-optimal large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.082149Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:9544328031ccf287b8f1558517339986bfac1c71b4ae86b7c570803b8c415bc1","observation_id":"b7630dd5-73ac-4352-be50-f252bdc34117","resolution":{"observed_at":"2026-08-07T15:26:50.082149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.912426Z","title":"Long-context llms meet rag: Overcoming challenges for long inputs in rag","venue":null,"work_id":"2b14a3cb-e1a6-413c-8382-7e04a5cf940c","year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.196189Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:775a1f8c74d5e645cb572935d2f66c05910f49d7f24b86ea8c65b9042f26ba7a","observation_id":"f6534b44-fd37-4592-977e-7376e1c91ff2","resolution":{"observed_at":"2026-08-07T15:26:58.985496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03699","last_updated":"2025-07-23T21:26:26Z","snapshot_observed_at":"2026-08-17T02:42:06.612301Z","submitted_at":"2025-02-06T01:22:06Z","title":"LLM Alignment as Retriever Optimization: An Information Retrieval Perspective","version":3},"cited_work":{"arxiv_id":"2502.03699","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03699","snapshot_observed_at":"2026-08-07T15:26:55.832369Z","title":"LLM Alignment as Retriever Optimization: An Information Retrieval Perspective","venue":"cs.CL","work_id":"48287252-8e15-42ae-87b0-e1262610ac90","year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.289327Z"},"links":{"cited_paper":"/paper/2502.03699","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:ac03a55bf541ac87aa7b3401e6b28cd72bb1079a7011eb756ad32951b6ef2d79","observation_id":"717a137d-4795-4d92-aa45-2f3bd6b12ce5","resolution":{"observed_at":"2026-08-07T15:26:55.887278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T15:26:50.403376Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.403376Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:38957c4e343f56e7d2a672d225ba2250e0059860d5dfa16ccb59fd29a5ebebf2","observation_id":"b058ef94-0010-4640-97d2-ae7ecdca5340","resolution":{"observed_at":"2026-08-07T15:26:50.403376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.770379Z","title":"Reinforcement learning: A survey","venue":null,"work_id":"ea74ade4-7d8b-4fb8-82c9-1a4e620ec0c8","year":1996},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.494200Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:bcc3efca2231f0e43231b3709d46fc35ccc48557593b1a9f2e6b114577132998","observation_id":"c3821500-bdf1-4fca-a0d4-f43e0ba4cc4c","resolution":{"observed_at":"2026-08-07T15:26:58.841646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T15:26:50.590956Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.590956Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:9a0cc5c315200edb635a46c2e10a040f92b1f96469fcd43cc3e9339108e9cbfd","observation_id":"19e1688c-cfa7-418e-a7fc-348c0c3c9b8c","resolution":{"observed_at":"2026-08-07T15:26:50.590956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.650590Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":"86fe5f5a-502d-40de-9df9-14c272276c8d","year":2020},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.679252Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:b54019ddb30a8bb60a456958f7414e13f974d9d5b4711c9e7fec5af7fb59dc65","observation_id":"03d37d64-fccf-4d4d-aba6-85a748414895","resolution":{"observed_at":"2026-08-07T15:26:58.703594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:50.748824Z","title":"A survey of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.748824Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:92593ea0d669dd33fe35abf4db5637f662f1dc9bbb3499e297d0e608bf71462f","observation_id":"ca007945-7e15-4249-a24c-414673a7b03d","resolution":{"observed_at":"2026-08-07T15:26:50.748824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:50.837507Z","title":"Natural questions: a benchmark for question answering research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.837507Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:89be1194c716353e820dfff4440ed3281ac7eb8a4d5521265f9bfca4ea78c7f9","observation_id":"4c94b57a-382e-430c-a0c6-0d0c5fc7a1a3","resolution":{"observed_at":"2026-08-07T15:26:50.837507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:50.909895Z","title":"Med-r1: Reinforce- ment learning for generalizable medical reasoning in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.909895Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:443c16d54727c184e9d6f5f2e4a99f522f7c561a6015bd62c73e68f1dd6a0af1","observation_id":"17f0a0b5-8016-4d30-81f7-4fe71c83a2e4","resolution":{"observed_at":"2026-08-07T15:26:50.909895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-17T18:23:08.323051Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T15:26:50.989095Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:50.989095Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:8d60d5b2db2b4717088b1a1c1780d30a4ce2b043646624e8822f52ce04d5a444","observation_id":"1f416758-8579-4885-887e-dad10bb3f9d6","resolution":{"observed_at":"2026-08-07T15:26:50.989095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.519296Z","title":"Large language models in finance: A survey","venue":null,"work_id":"5483cc8f-b359-446d-88ac-4e2ea5103e5a","year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.109969Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:f05b42e794b7fb83c273e5dfeb0a88bf15cc8a8cfa7826f285cb1a8dc9857c48","observation_id":"2f145531-f0a2-41ec-880f-42eba51ab072","resolution":{"observed_at":"2026-08-07T15:26:58.568392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:51.227945Z","title":"Rec-r1: Bridging generative large language mod- els and user-centric recommendation systems via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.227945Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:730fac03362cb31bfde6b65c60a32c70eab155d48bcd8e3bca5c821f02d1fd96","observation_id":"c74cf3b1-65ef-40d7-b028-718a802ccbb9","resolution":{"observed_at":"2026-08-07T15:26:51.227945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.399385Z","title":"Ra-dit: Retrieval-augmented dual instruction tuning","venue":null,"work_id":"d6bad3e6-5500-42f3-9359-b37525327544","year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.320200Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:3339ba81ad5edd9d05ce1c22a70f74f8470eb75cfb8691f4fbc3dacd072ad84a","observation_id":"31f92054-4f7e-4285-b9cf-38cd12aa6c34","resolution":{"observed_at":"2026-08-07T15:26:58.456715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14239","last_updated":"2025-04-19T09:25:55Z","snapshot_observed_at":"2026-08-17T01:19:33.866701Z","submitted_at":"2025-04-19T09:25:55Z","title":"InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14239","snapshot_observed_at":"2026-08-07T15:26:51.429733Z","title":"Infigui-r1: Advancing multimodal gui agents from reactive actors to deliberative reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.429733Z"},"links":{"cited_paper":"/paper/2504.14239","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:22ca1e197bc42bf41699b5c11ac0591d28050413777fb4997b5c36ad4ac47862","observation_id":"fca8fc0a-f564-42ca-9bd9-479b52f91105","resolution":{"observed_at":"2026-08-07T15:26:51.429733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:51.566362Z","title":"Fin-r1: A large language model for financial reasoning through reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.566362Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:70a53527e26bcc6cc2313938da29454e25bc166ee8f2c7ebd6c0b5fb9da3391d","observation_id":"341d1ffc-de10-4f4f-8fa8-20f9a82917f2","resolution":{"observed_at":"2026-08-07T15:26:51.566362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.258767Z","title":"Chatqa: Surpassing gpt-4 on conversational qa and rag","venue":null,"work_id":"53c1afe5-d421-4ba8-a2e9-d05b20993f0c","year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.658947Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:31614392e73c36a7d3b797469613c1999ec4b3c37c28283e796eea63e6f5ee79","observation_id":"5f61c753-65e0-45a0-ab56-5b0dee9f94a6","resolution":{"observed_at":"2026-08-07T15:26:58.324495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:58.116093Z","title":"Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs","venue":null,"work_id":"1b460e64-d434-43bf-9e3e-c0b13de68987","year":2018},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.746406Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:b12d1e437689190c90b3ff923c9704cb996869d8f38d32ae5fef9cd658170000","observation_id":"e7884401-3cf6-45d4-ad39-d78d65af419e","resolution":{"observed_at":"2026-08-07T15:26:58.190378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.908461Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"d5805ab5-030f-46ce-a199-a9fa4d9e709a","year":2022},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.844156Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:1d6cff1ef02243b0577246f7700931de603a860ea183ab74d9f96dce4468baf0","observation_id":"595bedd6-b420-4b9a-827b-64e5da074ae9","resolution":{"observed_at":"2026-08-07T15:26:57.990089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.761544Z","title":"A study of generative large language model for medical research and healthcare","venue":null,"work_id":"17d974f9-46b7-487b-8838-1875d784e990","year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:51.933207Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:c96e8e4f5e20d87fbc9937a49bd1cde279ffa7a51cca1ffa10ade1929e864da0","observation_id":"195f0ec1-8ef3-4d27-9893-765da6383166","resolution":{"observed_at":"2026-08-07T15:26:57.826853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-08-15T17:25:43.175408Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-07T15:26:52.033954Z","title":"Measuring and narrowing the compositionality gap in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.033954Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:46e311a8972f56488b110c31e0a27c1754320430e8b330bf46a94b3ceb91e01e","observation_id":"65ef205c-a837-428d-8b96-ef6feb42b081","resolution":{"observed_at":"2026-08-07T15:26:52.033954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:52.134087Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.134087Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:31f694e99e7a3c4d10f080a0f6704c3134274d3a183f571ba18bc39bdfb02602","observation_id":"5d464510-268c-4b36-b755-855e0b957174","resolution":{"observed_at":"2026-08-07T15:26:52.134087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.566787Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"c4403cc5-9f6f-4164-ae06-d838f52bd310","year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.283836Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:27b5b7a705f964540b9e1875a83033189450be228d64c8ca3757d55b5e3b0036","observation_id":"06269762-9b6c-417f-aa33-40161e185fee","resolution":{"observed_at":"2026-08-07T15:26:57.661037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.378248Z","title":"The probabilistic relevance framework: Bm25 and beyond","venue":null,"work_id":"12d025b7-c5e6-4a00-9e45-bfc543a222ca","year":2009},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.398976Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:61ae958c435283f79aaba8a0f1437cfe2575e962c021bb77bc0c51d58766cb33","observation_id":"900386d5-fcba-4598-9226-f38f09ab511a","resolution":{"observed_at":"2026-08-07T15:26:57.466025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:57.169448Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"0b584c54-c88d-414b-b672-da78be033a11","year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.535004Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:b15d3cddc74e5d76f37ae1a4de17f2193b843cfd3b153c03d3891f50e3e84ff5","observation_id":"40aa8960-f10e-434e-bb78-93857c0be9d5","resolution":{"observed_at":"2026-08-07T15:26:57.242610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:26:52.616549Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.616549Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:11f210637e608f58432f17d2494a8a3d975d947bb099201133caa12a3e3f949c","observation_id":"6b9a6faf-50e9-4218-a32b-4af6ddb29e7d","resolution":{"observed_at":"2026-08-07T15:26:52.616549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09136","last_updated":"2026-04-01T15:51:06Z","snapshot_observed_at":"2026-08-16T05:51:25.312210Z","submitted_at":"2025-01-15T20:40:25Z","title":"Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09136","snapshot_observed_at":"2026-08-07T15:26:52.754080Z","title":"Agentic retrieval-augmented generation: A survey on agentic rag","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.754080Z"},"links":{"cited_paper":"/paper/2501.09136","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:2e8e9aee18893f5ec8a0fdfba87c0e3351ffd93946500dde4d818a53f8b7ac19","observation_id":"9023e9e1-0bed-4620-812b-fabe429d2868","resolution":{"observed_at":"2026-08-07T15:26:52.754080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-15T04:19:26.319323Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T15:26:52.868730Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.868730Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:6165b2708b3d3a29f8e03fef66d56edc6e04037ea9e2b50e3c121fb02375770c","observation_id":"b6a6294c-588d-4f46-8ec0-7470b7666aad","resolution":{"observed_at":"2026-08-07T15:26:52.868730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06092","last_updated":"2023-01-22T14:25:40Z","snapshot_observed_at":"2026-08-17T08:55:40.071889Z","submitted_at":"2022-04-12T21:58:44Z","title":"ASQA: Factoid Questions Meet Long-Form Answers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06092","snapshot_observed_at":"2026-08-07T15:26:52.983403Z","title":"Asqa: Factoid questions meet long-form answers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:52.983403Z"},"links":{"cited_paper":"/paper/2204.06092","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:54a5607fb674d2d11d134265436f1d8d41b914cc072b570d75be79947d808d0a","observation_id":"7c40fc6e-ebcd-4414-b549-c8fb80e980cf","resolution":{"observed_at":"2026-08-07T15:26:52.983403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.962330Z","title":"Reinforcement learning","venue":null,"work_id":"e8146060-b731-40ec-b84a-2aded08d2eef","year":1999},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.080773Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:fcaa7521a1d2fdce2ef8ad7c7884649b051d9e6ba397b1ec6c94783bc5dd943f","observation_id":"3cd1d6d0-871e-4444-896f-883123a0a9ee","resolution":{"observed_at":"2026-08-07T15:26:57.086436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:26:53.199033Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.199033Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:e2ff070417514adeb59529a71f033701c4f703bef2d848b72bf6131eb7a66c43","observation_id":"4333ad5d-3a13-4dc5-b02c-a338220a6faf","resolution":{"observed_at":"2026-08-07T15:26:53.199033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10509","last_updated":"2023-06-23T00:59:13Z","snapshot_observed_at":"2026-08-15T17:29:02.957931Z","submitted_at":"2022-12-20T18:26:34Z","title":"Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10509","snapshot_observed_at":"2026-08-07T15:26:53.311795Z","title":"Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.311795Z"},"links":{"cited_paper":"/paper/2212.10509","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:ebd16c29396253b63649e4cccf8e3acd4e544c21b2155db58e30e0a16689207b","observation_id":"9903980d-f83a-470c-b809-9297b5fa6ff9","resolution":{"observed_at":"2026-08-07T15:26:53.311795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-08-07T15:26:53.451848Z","title":"Text embeddings by weakly-supervised contrastive pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.451848Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:b1e1e5e70317fe0eb1db42472d72ba9f96ba51556a1a4e880054884e1408d646","observation_id":"f818db25-cce8-4a26-b6db-dc0742739ac5","resolution":{"observed_at":"2026-08-07T15:26:53.451848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-08-15T17:20:54.840134Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T15:26:53.529810Z","title":"Reinforcement learning for reasoning in large language models with one training example","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.529810Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:fe11539f36767d6e845426046ce387d24fd9d7ee53bb59deeaadc3eb60ded235","observation_id":"13cd128c-5533-4061-9103-9dd198580236","resolution":{"observed_at":"2026-08-07T15:26:53.529810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-13T08:41:26.093022Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-07T15:26:53.665506Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.665506Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:91c424839765260da623fd0fb6c0dbadac8ec6068160acf2b73061775e1c45e0","observation_id":"1454a45e-770d-4911-bd2a-429324bdc637","resolution":{"observed_at":"2026-08-07T15:26:53.665506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.758476Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"6ca36448-29e7-4683-8424-48c95789693b","year":2022},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.780369Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:93e3df5fafb441a47c94ade7085289b7d72b460063d96c5ee9ca1a6d120fb203","observation_id":"e68b8865-606f-4ebd-82f2-24226fc8b8a3","resolution":{"observed_at":"2026-08-07T15:26:56.850656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T15:26:53.898164Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:53.898164Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:8b364851db669465dbb169afa6e58fc2313929d7d84ec71565ab43c2b2bb4998","observation_id":"29f35dad-8602-4e0c-91fc-4b05780a2a6c","resolution":{"observed_at":"2026-08-07T15:26:53.898164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.595090Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning","venue":null,"work_id":"a9368cb4-7048-4427-80fb-1b76f122067b","year":1992},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.004145Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:ec2cac82364ef1a5133ed5b22559c3120a41b04e5e46833d62053960e6c6ed9d","observation_id":"f124a3f5-834f-435a-9c0e-b74acc1ed4fd","resolution":{"observed_at":"2026-08-07T15:26:56.675204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-07T15:26:54.106018Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.106018Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:bf0705c9f1e3a371f6de661b772ed9ad9f45a15c0a6923784f02956183f5195b","observation_id":"bfd1f691-7fa0-4e1b-8cd1-5f61af21abd6","resolution":{"observed_at":"2026-08-07T15:26:54.106018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T15:26:54.279168Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.279168Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:6af19264b3edd89049fa4545f6127231914b49536cffdb9de06f923a6f5b8a7b","observation_id":"0be230af-cc11-4b04-9d36-a1791b7f2d74","resolution":{"observed_at":"2026-08-07T15:26:54.279168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:26:54.391914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.391914Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:336da008cf251271755b8ff59263c7c8886a057d7c2bbe970b7bb09b7e5e2e93","observation_id":"92849fa8-cbaf-4c54-a339-5130b46e8ab6","resolution":{"observed_at":"2026-08-07T15:26:54.391914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-17T01:54:11.006899Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-07T15:26:54.470888Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.470888Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:0f750f12bb55c5eede898aec2b31d8580edb03329dd1b6ed002ff828d513761a","observation_id":"0e2d6c4b-4939-4028-9f89-0c0439cf2f94","resolution":{"observed_at":"2026-08-07T15:26:54.470888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.403140Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"792fce9e-3bd2-46b0-955f-d5097e669651","year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.608235Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:ffb167a4bfcf0d2bf7512c580db71fa0a2eb56260980d7d92ad200b39d78470c","observation_id":"de6b9cce-e7d1-4489-ae11-6655f4e0edc3","resolution":{"observed_at":"2026-08-07T15:26:56.510314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:26:54.687871Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.687871Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:79de04c2ec3d0d94cb859bfa61659f46a14c9fe78f6ae76034b59687ba4415ce","observation_id":"33aab401-0b34-4dc2-9521-4f7dd023735e","resolution":{"observed_at":"2026-08-07T15:26:54.687871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T15:26:54.812847Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.812847Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:d87795eda6abaa07b7cfbdae07b33b38dcc0c7e58cefe7dedc99c1f152cb5fb6","observation_id":"aa196788-e30a-4150-803f-794700ddbea6","resolution":{"observed_at":"2026-08-07T15:26:54.812847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18013","last_updated":"2025-03-23T10:21:14Z","snapshot_observed_at":"2026-08-16T23:37:49.144529Z","submitted_at":"2025-03-23T10:21:14Z","title":"Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18013","snapshot_observed_at":"2026-08-07T15:26:54.929294Z","title":"Vision-r1: Evolving human-free alignment in large vision-language models via vision- guided reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:54.929294Z"},"links":{"cited_paper":"/paper/2503.18013","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:cc4be639ebeab98e46ff25ef5e401df21a6df372a1c280cb55f59cc1ac22c785","observation_id":"05a4234d-b062-4944-b633-d5c847f3be3c","resolution":{"observed_at":"2026-08-07T15:26:54.929294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.182541Z","title":"Benchmarking large language models for news summarization","venue":null,"work_id":"cfe329dc-0ef3-498c-b981-304eadb7ad85","year":2024},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.004398Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:754da56b15dcbf4bb2b769a8c035d11b37e768d73b2db4b89e2d72e76ffb22f5","observation_id":"e3747c8b-8768-4e14-af6c-d6ce749ab8c3","resolution":{"observed_at":"2026-08-07T15:26:56.319879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T15:26:55.141146Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.141146Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:6af61355c678ccc017375afc99f8692a4c0fabb0c4038e0af9794041f8ec47d1","observation_id":"a765309a-41f1-4b5f-a97f-40bee11c104a","resolution":{"observed_at":"2026-08-07T15:26:55.141146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03160","last_updated":"2025-04-17T04:46:08Z","snapshot_observed_at":"2026-08-16T20:41:16.782304Z","submitted_at":"2025-04-04T04:41:28Z","title":"DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03160","snapshot_observed_at":"2026-08-07T15:26:55.223022Z","title":"<| im_start | > as si sta nt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.223022Z"},"links":{"cited_paper":"/paper/2504.03160","citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:7bdace18aa7b849f2fda43a67108191f58bbe9310ace22dab91dc21f9ad5e1fb","observation_id":"46073e24-a2eb-43b6-9e9a-90fc8e3369fd","resolution":{"observed_at":"2026-08-07T15:26:55.223022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:26:56.025148Z","title":"Delicatessen","venue":null,"work_id":"b1986ac8-1659-47c4-aa8e-3c2d8c89e5d1","year":1991},"citing_paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents","version":1},"reference_index":1953,"source":"pdf_text","source_observed_at":"2026-08-07T15:26:55.346259Z"},"links":{"citing_paper":"/paper/2505.15117"},"observation_digest":"sha256:d41deae4c94d279cd08cdfe02cb0a5209d2fd2c30243a8269a1c78c96b4d9c20","observation_id":"6bb5f631-5897-445b-b8eb-09fd812f0456","resolution":{"observed_at":"2026-08-07T15:26:56.105243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15117","last_updated":"2025-05-21T05:09:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T15:29:12.679742Z","submitted_at":"2025-05-21T05:09:43Z","title":"An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":19},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 19 inbound Pith citation observations for arXiv:2505.15117."}