Pith. sign in

Paper Citation Record · LEDGER

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

As of 22 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 19 inbound Pith citation observations for arXiv:2505.15117.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.15117 v1

Coverage vector

measured 59 of 59 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:26:55.346259Z

measured 78 of 78 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 19 of 19 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T23:51:43.200350Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T00:55:12.126083Z

Reference resolution

59 of 59 outbound references displayed

  • verified exact1
  • verified fuzzy19
  • unresolved39
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a9c57f54-6a3f-411f-9cd5-c481acc54943 · outbound

This paper cites GPT-4 Technical Report.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.226134Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.226134Z digest=sha256:fc7eb89a21a77863ba80da389318b779932f9f730a65028aa0aa1da25a87e8ca

Observation 4b28661e-4667-436f-ad52-9e167fd09ce4 · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.330797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.330797Z digest=sha256:eb186d7c039889c552a86c4e8d9ee2ec751d029b635f69125483801daa2569a7

Observation 1fbacb48-e9af-47ef-884b-eb32fcb592d5 · outbound

This paper cites Self-rag: Learn- ing to retrieve, generate, and critique through self-reflection.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Self-rag: Learn- ing to retrieve, generate, and critique through self-reflection

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:59.157980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:49.410784Z digest=sha256:0c6873a60f2ff39db9649031d73dc1a7b023d238e863f31c7ad733a2382f8077

Observation 3c45f28c-547c-4ea1-a66b-c9457ded3b34 · outbound

This paper cites ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents ReSearch: Learning to Reason with Search for LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.507040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.507040Z digest=sha256:413882d48cbe330f618220f8d56badc4f971ac6d5e580f5c135b6fe684cffdae

Observation 4f6f5d45-770b-499d-a63b-ccc844135ad7 · outbound

This paper cites ELI5: Long Form Question Answering.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents ELI5: Long Form Question Answering

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.595880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.595880Z digest=sha256:70e660c43c0aa74bdaa989cdec58b9d68f52c98c213802346d7f570cf7caa252

Observation 7b898ac7-96ce-4443-a0e5-0a274b00fb5d · outbound

This paper cites Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.679749Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.679749Z digest=sha256:326420ae49d3c50232952c9169f879f90a873f92992c98def53ebbab449e4456

Observation 56345dbc-a3ed-4a1c-bf4e-68a59f2c5470 · outbound

This paper cites Retrieval-Augmented Generation for Large Language Models: A Survey.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Retrieval-Augmented Generation for Large Language Models: A Survey

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.769546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.769546Z digest=sha256:a33d4db754c2497045d85129fedc8029d684044dfbd51045ed40e3698d37ec9f

Observation a9547765-daaf-4d6a-b000-24d7e114b491 · outbound

This paper cites A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents A Confederacy of Models: a Comprehensive Evaluation of LLMs on Creative Writing

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.877999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.877999Z digest=sha256:249cc6aa6ebe33886ee9052beaa6d12e22f517535445f8fc1bba9025bc668055

Observation 585497cc-a9c9-4f4b-81bb-fa58ff551145 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:49.967806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:49.967806Z digest=sha256:02bb3d56b81a854924ee3da470d0af31d02047ef5ad70eaf2db7fc3a4d94c064

Observation b7630dd5-73ac-4352-be50-f252bdc34117 · outbound

This paper cites Training Compute-Optimal Large Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Training Compute-Optimal Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.082149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.082149Z digest=sha256:a403a03bae9d1c73e362a325c72ed3cd63728db4ced3572d79107b8033e2ad94

Observation f6534b44-fd37-4592-977e-7376e1c91ff2 · outbound

This paper cites Long-context llms meet rag: Overcoming challenges for long inputs in rag.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Long-context llms meet rag: Overcoming challenges for long inputs in rag

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.985496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:50.196189Z digest=sha256:342cd9f47136f232b9b327570051f5207a9db93a954a780c788e26bef4da7838

Observation 717a137d-4795-4d92-aa45-2f3bd6b12ce5 · outbound

This paper cites LLM Alignment as Retriever Optimization: An Information Retrieval Perspective.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents LLM Alignment as Retriever Optimization: An Information Retrieval Perspective

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-08-07T15:26:55.887278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:50.289327Z digest=sha256:ca50f3b31fa6ad870d4f1af4e82a4332f02bb4f7a1586f59c351bd3b3878e551

Observation b058ef94-0010-4640-97d2-ae7ecdca5340 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.403376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.403376Z digest=sha256:38957c4e343f56e7d2a672d225ba2250e0059860d5dfa16ccb59fd29a5ebebf2

Observation c3821500-bdf1-4fca-a0d4-f43e0ba4cc4c · outbound

This paper cites Reinforcement learning: A survey.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Reinforcement learning: A survey

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.841646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:50.494200Z digest=sha256:6f5bac4774fe65d3398f1e2035f13929b103f7b8ef5cd04a64f5c6fcde563cbc

Observation 19e1688c-cfa7-418e-a7fc-348c0c3c9b8c · outbound

This paper cites Scaling Laws for Neural Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Scaling Laws for Neural Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.590956Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.590956Z digest=sha256:9a0cc5c315200edb635a46c2e10a040f92b1f96469fcd43cc3e9339108e9cbfd

Observation 03d37d64-fccf-4d4d-aba6-85a748414895 · outbound

This paper cites Dense passage retrieval for open-domain question answering.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Dense passage retrieval for open-domain question answering

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.703594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:50.679252Z digest=sha256:0ccdf1ee195ee24f42f859b4206c64d16d3b994ddddd5252269ac0c583b39ea0

Observation ca007945-7e15-4249-a24c-414673a7b03d · outbound

This paper cites A survey of reinforcement learning from human feedback.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents A survey of reinforcement learning from human feedback

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.748824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.748824Z digest=sha256:92593ea0d669dd33fe35abf4db5637f662f1dc9bbb3499e297d0e608bf71462f

Observation 4c94b57a-382e-430c-a0c6-0d0c5fc7a1a3 · outbound

This paper cites Natural questions: a benchmark for question answering research.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Natural questions: a benchmark for question answering research

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.837507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.837507Z digest=sha256:89be1194c716353e820dfff4440ed3281ac7eb8a4d5521265f9bfca4ea78c7f9

Observation 17f0a0b5-8016-4d30-81f7-4fe71c83a2e4 · outbound

This paper cites Med-r1: Reinforce- ment learning for generalizable medical reasoning in vision-language models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Med-r1: Reinforce- ment learning for generalizable medical reasoning in vision-language models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.909895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.909895Z digest=sha256:443c16d54727c184e9d6f5f2e4a99f522f7c561a6015bd62c73e68f1dd6a0af1

Observation 1f416758-8579-4885-887e-dad10bb3f9d6 · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents RewardBench: Evaluating Reward Models for Language Modeling

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:50.989095Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:50.989095Z digest=sha256:eb4da4fd474ee04255a3d8fca0235eccde28f8b8bcd21cc0665c4afd99a4d06d

Observation 2f145531-f0a2-41ec-880f-42eba51ab072 · outbound

This paper cites Large language models in finance: A survey.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Large language models in finance: A survey

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.568392Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:51.109969Z digest=sha256:e27df4b98f724612e27c9c0b732960419def707de416a13a49ceab1b8ed71cc3

Observation c74cf3b1-65ef-40d7-b028-718a802ccbb9 · outbound

This paper cites Rec-r1: Bridging generative large language mod- els and user-centric recommendation systems via reinforcement learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Rec-r1: Bridging generative large language mod- els and user-centric recommendation systems via reinforcement learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:51.227945Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:51.227945Z digest=sha256:730fac03362cb31bfde6b65c60a32c70eab155d48bcd8e3bca5c821f02d1fd96

Observation 31f92054-4f7e-4285-b9cf-38cd12aa6c34 · outbound

This paper cites Ra-dit: Retrieval-augmented dual instruction tuning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Ra-dit: Retrieval-augmented dual instruction tuning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.456715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:51.320200Z digest=sha256:cf8b4a220558993a2ce6b393b5e445c5d976525c43c1ab004d8c66fcabac7ea1

Observation fca8fc0a-f564-42ca-9bd9-479b52f91105 · outbound

This paper cites InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:51.429733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:51.429733Z digest=sha256:22ca1e197bc42bf41699b5c11ac0591d28050413777fb4997b5c36ad4ac47862

Observation 341d1ffc-de10-4f4f-8fa8-20f9a82917f2 · outbound

This paper cites Fin-r1: A large language model for financial reasoning through reinforcement learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Fin-r1: A large language model for financial reasoning through reinforcement learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:51.566362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:51.566362Z digest=sha256:70a53527e26bcc6cc2313938da29454e25bc166ee8f2c7ebd6c0b5fb9da3391d

Observation 5f61c753-65e0-45a0-ab56-5b0dee9f94a6 · outbound

This paper cites Chatqa: Surpassing gpt-4 on conversational qa and rag.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Chatqa: Surpassing gpt-4 on conversational qa and rag

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.324495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:51.658947Z digest=sha256:3a1a530a8f646f0aada4b38ca24df205b0c40bdb1113565bc60d91007e8fa42d

Observation e7884401-3cf6-45d4-ad39-d78d65af419e · outbound

This paper cites Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Efficient and robust approximate nearest neighbor search using hierarchical navigable small world graphs

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:58.190378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:51.746406Z digest=sha256:64731bb1cc4e0cc3b87b8a064668e17b9b8eb28ae3964f9b467cb1cffb46a28b

Observation 595bedd6-b420-4b9a-827b-64e5da074ae9 · outbound

This paper cites Training language models to follow instructions with human feedback.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Training language models to follow instructions with human feedback

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.990089Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:51.844156Z digest=sha256:0738c3c4661eb997d7c0c1ff071bfec085347da15a6c506bb2f562f04af951e3

Observation 195f0ec1-8ef3-4d27-9893-765da6383166 · outbound

This paper cites A study of generative large language model for medical research and healthcare.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents A study of generative large language model for medical research and healthcare

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.826853Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:51.933207Z digest=sha256:17ec0f45f7c6124ac7a24b35b3d6a11c0180e1e5d91a6939a081358cc30e1dcf

Observation 65ef205c-a837-428d-8b96-ef6feb42b081 · outbound

This paper cites Measuring and Narrowing the Compositionality Gap in Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Measuring and Narrowing the Compositionality Gap in Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.033954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.033954Z digest=sha256:1da691aa59d6c75a42e49e61f03346ef470384843f311d18aa2d0ffeb4057976

Observation 5d464510-268c-4b36-b755-855e0b957174 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Direct preference optimization: Your language model is secretly a reward model

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.134087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.134087Z digest=sha256:31f694e99e7a3c4d10f080a0f6704c3134274d3a183f571ba18bc39bdfb02602

Observation 06269762-9b6c-417f-aa33-40161e185fee · outbound

This paper cites Gpqa: A graduate-level google-proof q&a benchmark.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Gpqa: A graduate-level google-proof q&a benchmark

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.661037Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:52.283836Z digest=sha256:397e4f98ac384e1aa76e621c80b097cdc700ca697d2c3610705cea31e392a10c

Observation 900386d5-fcba-4598-9226-f38f09ab511a · outbound

This paper cites The probabilistic relevance framework: Bm25 and beyond.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents The probabilistic relevance framework: Bm25 and beyond

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.466025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:52.398976Z digest=sha256:e9b6bdfe2e7b8790816e0192133fc33fa8505110f9c0764275d1a52ea2212417

Observation 40aa8960-f10e-434e-bb78-93857c0be9d5 · outbound

This paper cites Toolformer: Language models can teach themselves to use tools.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Toolformer: Language models can teach themselves to use tools

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.242610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:52.535004Z digest=sha256:1db13bbe2cee77b455c49a66ed282e5aebd357d092c4b5a3aa19602d1640c4a5

Observation 6b9a6faf-50e9-4218-a32b-4af6ddb29e7d · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.616549Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.616549Z digest=sha256:11f210637e608f58432f17d2494a8a3d975d947bb099201133caa12a3e3f949c

Observation 9023e9e1-0bed-4620-812b-fabe429d2868 · outbound

This paper cites Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.754080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.754080Z digest=sha256:2e8e9aee18893f5ec8a0fdfba87c0e3351ffd93946500dde4d818a53f8b7ac19

Observation b6a6294c-588d-4f46-8ec0-7470b7666aad · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.868730Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.868730Z digest=sha256:6165b2708b3d3a29f8e03fef66d56edc6e04037ea9e2b50e3c121fb02375770c

Observation 7c40fc6e-ebcd-4414-b549-c8fb80e980cf · outbound

This paper cites ASQA: Factoid Questions Meet Long-Form Answers.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents ASQA: Factoid Questions Meet Long-Form Answers

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:52.983403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:52.983403Z digest=sha256:a8b6f6a0f26205ca404f86c3a01a62748fb6625e9a6654804ebc79413ae4f457

Observation 3cd1d6d0-871e-4444-896f-883123a0a9ee · outbound

This paper cites Reinforcement learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Reinforcement learning

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:57.086436Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:53.080773Z digest=sha256:ce16a653de87bde696c661f2b117d4c5702cfe770d87a3af0ca70caed2d7a6e8

Observation 4333ad5d-3a13-4dc5-b02c-a338220a6faf · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.199033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.199033Z digest=sha256:e2ff070417514adeb59529a71f033701c4f703bef2d848b72bf6131eb7a66c43

Observation 9903980d-f83a-470c-b809-9297b5fa6ff9 · outbound

This paper cites Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.311795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.311795Z digest=sha256:ebd16c29396253b63649e4cccf8e3acd4e544c21b2155db58e30e0a16689207b

Observation f818db25-cce8-4a26-b6db-dc0742739ac5 · outbound

This paper cites Text Embeddings by Weakly-Supervised Contrastive Pre-training.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Text Embeddings by Weakly-Supervised Contrastive Pre-training

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.451848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.451848Z digest=sha256:b1e1e5e70317fe0eb1db42472d72ba9f96ba51556a1a4e880054884e1408d646

Observation 13cd128c-5533-4061-9103-9dd198580236 · outbound

This paper cites Reinforcement Learning for Reasoning in Large Language Models with One Training Example.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.529810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.529810Z digest=sha256:fe11539f36767d6e845426046ce387d24fd9d7ee53bb59deeaadc3eb60ded235

Observation 1454a45e-770d-4911-bd2a-429324bdc637 · outbound

This paper cites RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.665506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.665506Z digest=sha256:91c424839765260da623fd0fb6c0dbadac8ec6068160acf2b73061775e1c45e0

Observation e68b8865-606f-4ebd-82f2-24226fc8b8a3 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Chain-of-thought prompting elicits reasoning in large language models

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.850656Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:53.780369Z digest=sha256:4b71e6d058002c11dcb91ba2191dc05aa9c2bf94c0b5308ebbd6770415b75ee2

Observation 29f35dad-8602-4e0c-91fc-4b05780a2a6c · outbound

This paper cites Measuring short-form factuality in large language models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Measuring short-form factuality in large language models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:53.898164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:53.898164Z digest=sha256:8b364851db669465dbb169afa6e58fc2313929d7d84ec71565ab43c2b2bb4998

Observation f124a3f5-834f-435a-9c0e-b74acc1ed4fd · outbound

This paper cites Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Simple statistical gradient-following algorithms for connectionist reinforce- ment learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.675204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:54.004145Z digest=sha256:c8aaac254a6fa9c0b3132e06e3e22187105bfd254b09fa07b1930ac2a682b40b

Observation bfd1f691-7fa0-4e1b-8cd1-5f61af21abd6 · outbound

This paper cites GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.106018Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.106018Z digest=sha256:bf0705c9f1e3a371f6de661b772ed9ad9f45a15c0a6923784f02956183f5195b

Observation 0be230af-cc11-4b04-9d36-a1791b7f2d74 · outbound

This paper cites Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.279168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.279168Z digest=sha256:6af19264b3edd89049fa4545f6127231914b49536cffdb9de06f923a6f5b8a7b

Observation 92849fa8-cbaf-4c54-a339-5130b46e8ab6 · outbound

This paper cites Qwen2.5 Technical Report.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Qwen2.5 Technical Report

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.391914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.391914Z digest=sha256:336da008cf251271755b8ff59263c7c8886a057d7c2bbe970b7bb09b7e5e2e93

Observation 0e2d6c4b-4939-4028-9f89-0c0439cf2f94 · outbound

This paper cites HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.470888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.470888Z digest=sha256:0f750f12bb55c5eede898aec2b31d8580edb03329dd1b6ed002ff828d513761a

Observation de6b9cce-e7d1-4489-ae11-6655f4e0edc3 · outbound

This paper cites React: Synergizing reasoning and acting in language models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents React: Synergizing reasoning and acting in language models

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.510314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:54.608235Z digest=sha256:17e4f297bece24559748cd787c9b52df156e955d36d6180a96af1e98e0632354

Observation 33aab401-0b34-4dc2-9521-4f7dd023735e · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.687871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.687871Z digest=sha256:79de04c2ec3d0d94cb859bfa61659f46a14c9fe78f6ae76034b59687ba4415ce

Observation aa196788-e30a-4150-803f-794700ddbea6 · outbound

This paper cites VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.812847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.812847Z digest=sha256:d87795eda6abaa07b7cfbdae07b33b38dcc0c7e58cefe7dedc99c1f152cb5fb6

Observation 05a4234d-b062-4944-b633-d5c847f3be3c · outbound

This paper cites Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:54.929294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:54.929294Z digest=sha256:cc4be639ebeab98e46ff25ef5e401df21a6df372a1c280cb55f59cc1ac22c785

Observation e3747c8b-8768-4e14-af6c-d6ce749ab8c3 · outbound

This paper cites Benchmarking large language models for news summarization.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Benchmarking large language models for news summarization

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.319879Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:55.004398Z digest=sha256:7a749156f3d10a94de03e825588edfa664bd588c66bd89566971d8bea2557a28

Observation a765309a-41f1-4b5f-a97f-40bee11c104a · outbound

This paper cites A Survey of Large Language Models.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents A Survey of Large Language Models

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:55.141146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:55.141146Z digest=sha256:6af61355c678ccc017375afc99f8692a4c0fabb0c4038e0af9794041f8ec47d1

Observation 46073e24-a2eb-43b6-9e9a-90fc8e3369fd · outbound

This paper cites DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T15:26:55.223022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:26:55.223022Z digest=sha256:7bdace18aa7b849f2fda43a67108191f58bbe9310ace22dab91dc21f9ad5e1fb

Observation 6bb5f631-5897-445b-b8eb-09fd812f0456 · outbound

This paper cites Delicatessen.

An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents Delicatessen

Reference 1953

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:26:56.105243Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-07T15:26:55.346259Z digest=sha256:fddd5641e2c837338c112533dc846461bc1ad89e96dea5bcd34f1c55e9a49236

Pith citing papers

Observation 38b539da-c53c-43a2-8365-fcfcebcd6817 · inbound

A Vision for Geo-Temporal Deep Research Systems: Towards Comprehensive, Transparent, and Reproducible Geo-Temporal Information Synthesis cites this paper.

A Vision for Geo-Temporal Deep Research Systems: Towards Comprehensive, Transparent, and Reproducible Geo-Temporal Information Synthesis An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T00:22:18.164811Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:22:18.164811Z digest=sha256:895a94b9e5ffdb5be8b2d03a9253e06ad0431eede4b9cc6c183751fdf257be0b

Observation d87aa6c1-0808-4f41-9a4d-e7235a8a94d3 · inbound

MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning cites this paper.

MetaAgent: Toward Self-Evolving Agent via Tool Meta-Learning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T10:17:13.579736Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T10:17:13.579736Z digest=sha256:7fc45bf86af3806b94d5f01da142ef8f585ee2b6b2867a323a4003e7772acfd6

Observation 11891e05-7f2a-46ad-a05b-74e367e31854 · inbound

BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent cites this paper.

BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T22:46:12.625929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:46:12.625929Z digest=sha256:58a4816e5561015f1595790c505d982249db9704a9a1e7db90df7f3c4be02b40

Observation 3e06a672-a89a-4390-a2df-320dc727fe33 · inbound

SSRL: Self-Search Reinforcement Learning cites this paper.

SSRL: Self-Search Reinforcement Learning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T20:17:09.393341Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:17:09.393341Z digest=sha256:4b6c19b252ccb601af34e1313065a684a753c8e8e6be1b6754cade3a842b629a

Observation 6252f0a3-8341-473e-9c5e-a6ab0203c525 · inbound

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning cites this paper.

AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T16:08:39.097595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T16:08:39.097595Z digest=sha256:47cf7e432a9b6b30e5dd66dfa95103e812fded525a6a98f816fe1544b897e9f7

Observation 9b1aa506-a3b4-4efe-be0a-52109793cfd1 · inbound

A Survey of Reinforcement Learning for Large Reasoning Models cites this paper.

A Survey of Reinforcement Learning for Large Reasoning Models An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 244

Resolution
verified exact
arxiv_id, observed 2026-05-18T00:02:24.586905Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-18T00:02:24.352947Z digest=sha256:4a7557dd31ed82665d203db3fff5316365ac782f8dfdeb2e78d96f4562a34365

Observation 0fcab628-5b5b-4eea-af6c-c1a9c9c9a03d · inbound

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs cites this paper.

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-18T11:11:18.283961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-18T11:06:20.058342Z digest=sha256:ea7c125e8683a1afb568f5e9d2619a60a402fbd743629e7bbe629df09973f5c9

Observation 6118e055-e4d6-4a0d-a75a-e3427ebcc2c3 · inbound

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation cites this paper.

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T09:50:45.763606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T09:50:45.763606Z digest=sha256:43773fee8598abb631d4a9ba6381a87a7b290434e65d62620507b20860525a76

Observation 785a30ee-2b24-48a5-af96-a455692b9848 · inbound

Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search cites this paper.

Lost in the Maze: Overcoming Context Limitations in Long-Horizon Agentic Search An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T08:48:40.941733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T08:48:40.941733Z digest=sha256:2707368fccad37bd529cb75033640cb13d7694c1493d9e22adcb09579a477332

Observation 85761933-03a2-4669-961f-021236f6c4fc · inbound

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework cites this paper.

TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-03T23:33:45.833809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T23:33:45.833809Z digest=sha256:e18856392c330088f855cb098eeebd8c2edf2e47bc87c73ed6a1e92da93363f7

Observation f189d6d9-658d-4f1c-98a6-3b1e506dc583 · inbound

ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning cites this paper.

ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T17:53:54.804421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T17:53:54.804421Z digest=sha256:4a67225502f6a5b339c8f45e8c54edfa9f03ef3d9964aa5c7098e225499b7e7b

Observation 7cb12523-4345-4d84-a68f-d2958bf61d59 · inbound

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data cites this paper.

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-05-11T16:46:06.919257Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-09T15:08:53.731480Z digest=sha256:799365e7943ccb1ffffc19678022b5d0bff764ad2b81c9e1fd87db0e25bbe38c

Observation 600bc524-c3a1-494f-99ec-69a625a52d40 · inbound

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data cites this paper.

$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 10

Resolution
verified exact
arxiv_id, observed 2026-07-01T00:55:12.127996Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-07-01T00:48:54.797750Z digest=sha256:cbfbea4bf209a7535cf6b8b53cf1aaebee52cf0d7a9084cb5bec5be51886ea96

Observation d8193e3d-2d96-468a-b0f0-524b0649de2b · inbound

Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning cites this paper.

Verbal-R3: Verbal Reranker as the Missing Bridge between Retrieval and Reasoning An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 20

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T16:51:08.796266Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-09T14:40:23.170932Z digest=sha256:50245ed653ace61ced442231d05065734a4e48ad2c3886209d05c805a4c84c14

Observation e03c2656-8aee-4852-8bbf-20f7a3d434a2 · inbound

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG cites this paper.

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:01:12.045981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-08T10:27:00.257353Z digest=sha256:2256655bf8af70692fedaa84fc49801aa99ce1b58bccdc8207d4cd7ff54e666f

Observation 8fcae104-3086-451d-888d-490e03e36875 · inbound

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents cites this paper.

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 21

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T12:53:26.519864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-29T12:50:16.625077Z digest=sha256:97df8cba82aaaf308aec41e3a3f9c86a8fe006f98692ca93e0099a3e00e994d2

Observation fe7c2143-8f14-4272-87fe-6dcc857aabba · inbound

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents cites this paper.

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T03:10:51.532947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T03:10:51.532947Z digest=sha256:405c4872af22a7dd730341d16c8ae57b5a23de74682a14eab054be66168e223d

Observation 3f450e9f-b910-4ae1-be33-eae85bac52ea · inbound

TCPO: Turn-Level Credit Policy Optimization cites this paper.

TCPO: Turn-Level Credit Policy Optimization An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T23:23:14.639942Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:23:14.639942Z digest=sha256:a901c29ae61983205604ebd9ef84e0ae1ff6f9f34157f9dbe85eb198ff052e7e

Observation bbcfe5a8-7c4d-4729-bd5c-0faf5bb04904 · inbound

Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents cites this paper.

Beyond Outcome Rewards: Step-Level Self-Distilled Policy Optimization for Deep Search Agents An Empirical Study on Reinforcement Learning for Reasoning-Search Interleaved LLM Agents

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T23:51:43.200350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T23:51:43.200350Z digest=sha256:bed6db84e60f1229a0d53f2172f14c52efb80832eb01bf34079254be92aa09b1