Pith. sign in

Paper Citation Record · LEDGER

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

As of 17 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 14 inbound Pith citation observations for arXiv:2506.04185.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.04185 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T10:54:30.541560Z

measured 58 of 58 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 14 of 14 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T21:12:12.793725Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T06:19:38.663842Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact2
  • verified fuzzy1
  • unresolved40
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation fbdc3536-4226-4620-aa14-1d80f49ea013 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 1

Resolution
verified exact
doi, observed 2026-08-07T10:54:31.014255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.274335Z digest=sha256:7099a7dc94ea0245c5741fb0495a979ced0bbe4a9cdfbb7e0a0751aa4eff70a5

Observation c155b641-b8d7-4924-8234-4a2ea31e74bf · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.280264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.280264Z digest=sha256:0beede4024f0ad8143b188ed7e91b8a3aa52b5a99048b635b410a66e173a6731

Observation 728e8402-de64-4bb0-9f16-18a2cbdb3567 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.438391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.285547Z digest=sha256:344318b0a0c5ff7a857a31afeef27c54451c7ec68407949a4661d5fa83a61200

Observation f14615f3-bf2f-4d9f-a4a3-038dbcb03f25 · outbound

This paper cites RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.291283Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.291283Z digest=sha256:7ef3251728e55e5eb99f268ac5710fd4c816c42d6fa33a57b04ba824286a1748

Observation 0458c6c1-fb1a-4acc-99d6-97775c449014 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.422082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.296904Z digest=sha256:94096cb3f8ef51bfa6edb276edbbd06286fac13aa236e82dd81a8ef2feea4afb

Observation ea1ee574-c118-4222-b4dd-7a7a6fd9f773 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.405352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.302594Z digest=sha256:db5b61da1800578b2b6f3100482c3b224cf530cb8a8fc25fae9c68d07155072a

Observation b5b447c7-48d1-455a-bb56-c6389374d78c · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.308393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.308393Z digest=sha256:db280bfc98ae220802c9b6d99c31769bdc32fd956abbe94c055a973345dc5985

Observation e4d27694-6d90-4eab-b4c9-3dfd99f42d05 · outbound

This paper cites Retrieval-Augmented Generation for Large Language Models: A Survey.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Retrieval-Augmented Generation for Large Language Models: A Survey

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.313372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.313372Z digest=sha256:c6622c327d16a96ec9f59a7c7a1a56e9b645e703e4d857a893dbd13d136a6815

Observation aefe27e4-2382-442a-85b2-ee35c1f8f2b1 · outbound

This paper cites DeepRAG: Thinking to Retrieve Step by Step for Large Language Models.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning DeepRAG: Thinking to Retrieve Step by Step for Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.319046Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.319046Z digest=sha256:365df72275d6bd191f2760d07b796fdbbc962a9ab8406535fe5c7a204100eba9

Observation 3dae0aa0-caff-4bfd-a084-1803c332fe30 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.324627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.324627Z digest=sha256:a9373546fc327b32f567738197e08814891cbea1fb9e2ac381a2fa4e66329515

Observation a2117c3f-9435-42da-923f-427d56c31482 · outbound

This paper cites REALM: Retrieval-Augmented Language Model Pre-Training.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning REALM: Retrieval-Augmented Language Model Pre-Training

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.330000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.330000Z digest=sha256:ad3c31e2a3a7f1da9e4039e5cf803f22865eb67222107d7f4339f6e6559ecf3c

Observation f8cb34d6-2812-41e1-bfc2-cf3f690c9db6 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.338794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.338794Z digest=sha256:94c621726f42c09ada321f29f18a6a043fff9466e7f2ecc905875e4057c405c9

Observation 7f6099d7-897f-4297-ab19-3e0e65e07534 · outbound

This paper cites OpenAI o1 System Card.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning OpenAI o1 System Card

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.344581Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.344581Z digest=sha256:92745dabd6180f7939d97f6704cfae970924b0dbb6670d4fcf517d763a78be9e

Observation 408e75e1-1756-4072-9b89-bcf8d9d25e38 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.350126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.350126Z digest=sha256:8c9f52afa7e1a178f7908a764bdc791161e3423aff9e37b0298191296128ee57

Observation 52555175-f859-48d1-9c71-24b6822bb064 · outbound

This paper cites Xu, Luyu Gao, Zhiqing Sun, Qian Liu, Jane Dwivedi - Yu, Yiming Yang, Jamie Callan, and Graham Neubig.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Xu, Luyu Gao, Zhiqing Sun, Qian Liu, Jane Dwivedi - Yu, Yiming Yang, Jamie Callan, and Graham Neubig

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.355185Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.355185Z digest=sha256:49385da344d71d6e7f77f6586655c96c55c28401d579209b4e3b069e29c32fb0

Observation c274fb56-4c2b-4edd-af2c-0b8fb4f8b6e6 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.360587Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.360587Z digest=sha256:79ed3baa69599292cd44d93d39d0d2f89ce298329a2bd548bcda8fd3a18a88ff

Observation 9c9dacb0-3a3c-45a9-854f-ae11ede5480e · outbound

This paper cites FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.366802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.366802Z digest=sha256:7fb0786d1c90ebaae332acd867c075fcbf25d8e1be806343d9b88e0666cc4be1

Observation 627dcc3a-6959-49c1-b1bf-f05d5267f601 · outbound

This paper cites Weld, and Luke Zettlemoyer.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Weld, and Luke Zettlemoyer

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.372406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.372406Z digest=sha256:47e3a420e838ea7bb27c7e1e2a9dcd1b510f5265e2e04466fcdcffe24616b05f

Observation 20bd6a40-5b96-4d90-a4ef-8a52550e4607 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.377138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.377138Z digest=sha256:9bd7ad8839115e49d244a906b535614b13fbcc051b0b28344b9b3e7d1b2fd1de

Observation 2c522333-8a80-4eb4-8078-4b876b79c84a · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.382234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.382234Z digest=sha256:71996f02282ad3b65c4c9593c282780fce18c70410a06d532c8cb76c4cbdd8e0

Observation 17d2ab95-057d-402f-9bee-7ed50560ea97 · outbound

This paper cites Training Language Models to Self-Correct via Reinforcement Learning.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Training Language Models to Self-Correct via Reinforcement Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.386949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.386949Z digest=sha256:cba17a86500ac75465449f568fcea60188221462702ea971d8e5d5c5c6535fdf

Observation ca83f98c-38fb-4070-ab48-be9fd457c959 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.396880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.396880Z digest=sha256:eba6b364a890e97df8ce3f19169e79ec15b27e2d51a5f7c2e0c6657be4e84878

Observation 3a196208-39d9-4970-9db7-a4b97e708d13 · outbound

This paper cites u ttler, Mike Lewis, Wen - tau Yih, Tim Rockt \.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning u ttler, Mike Lewis, Wen - tau Yih, Tim Rockt \

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.402416Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.402416Z digest=sha256:73f69215aec9c6465b7834056776b74d42668a3aaabd4cf8bb7ee10a26c8d7c7

Observation 46fda872-3ffb-4558-a455-605f44d7e1c4 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.407013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.407013Z digest=sha256:18b852f33c196f7b2d59c755fe177901a33bbbf3df2e7fa73e3393c2deea31ee

Observation c433b464-ea9f-4427-b624-05adb958da6f · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.352675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.411984Z digest=sha256:2339a7a81cbcd4512f59c681b4bc0b953c97e2f9e293b16391a10a56201a8717

Observation c24b190f-2bfa-4b03-aadd-3d8b7aed4419 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.334046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.417627Z digest=sha256:60b1ba6d4598bf6e1619b18bf12d941dcabbf079ce10aa5b94e09e2872a47a76

Observation f8bb9a67-7d7d-4f46-b83f-0bd423b7d5cf · outbound

This paper cites GPT-4 Technical Report.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning GPT-4 Technical Report

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.426294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.426294Z digest=sha256:e3aafaf103cccd5ddd98b6e0aef4e84b7a5d7f2c16552f82aa24549054f56fe5

Observation 6d686e0a-dd7c-4f91-acc8-61c7629fb771 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 29

Resolution
verified exact
doi, observed 2026-08-07T10:54:30.814271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.433102Z digest=sha256:0232f5b0721f6646380837ae6f45e4ede20c5d0340e112c106ceb54400d949d1

Observation dc63a20b-8944-4eb4-bc6d-1ece1d2221cb · outbound

This paper cites Smith, and Mike Lewis.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Smith, and Mike Lewis

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.438229Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.438229Z digest=sha256:97c6f7c5feb4b9a11a803259ac5285e7aa1d16d587fb7c9cff8ad88acac2dc32

Observation fcf82ccf-3bca-47ba-9c8a-d3e1b1016088 · outbound

This paper cites Hamilton, Chris Dyer, and Dani Yogatama.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Hamilton, Chris Dyer, and Dani Yogatama

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:54:31.317364Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.452391Z digest=sha256:e227591c8483d66aaf4f2f7a000cbf1bdacc0fb79ee7d546648ad1421946c07b

Observation bae75213-a5d1-42b0-86b0-f506496e4722 · outbound

This paper cites Proximal Policy Optimization Algorithms.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.459827Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.459827Z digest=sha256:cc594ce0d95b385f8a4a50a777db901b8ac0e3a984e0446a213439e0ccf54f76

Observation c30857ee-2823-4424-89db-3c9bbfc19591 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.469858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.469858Z digest=sha256:58e28553bde05c252807055a32adaea7e23ab215cb4a0d62e8b5d78322d394ff

Observation d8032718-9c9e-405e-a0c7-87b19773f16c · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.477067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.477067Z digest=sha256:1520fb2b0a3c1a1d7b912b1eab8e22134e82e75f712d9cf8bcae6f1e7378314b

Observation 18bd1d35-7962-433c-85db-c9a5f62d1ff6 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.490021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.490021Z digest=sha256:a2baa2e2315edfb2199720cefb1789ab629010871e6facec309b0743eaefd8e6

Observation bd59f18c-0d90-4f7e-a453-cdf0ff7fbca9 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 37

Resolution
malformed identifier
no resolver link, observed 2026-08-07T10:54:30.496064Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.496064Z digest=sha256:554db503ebfbc5f74c020a5c4244e8e2da4ad4acc8fc5626752ddddc11143b0f

Observation af55d101-5b80-4f5e-ac71-85e70df80ed6 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.500940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.500940Z digest=sha256:9622f9b4fe03ca1d4a9e1b459433da0bf1cf8d09920a2ce83138ee0ea2f99278

Observation c931d564-86c3-4854-8096-736595ec00c7 · outbound

This paper cites Large Language Models are Better Reasoners with Self-Verification.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Large Language Models are Better Reasoners with Self-Verification

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.506047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.506047Z digest=sha256:b64e6af3e1f90d5c8e27e3f4055e1715ea444a4baa5cfbc4a4aca0c247947d97

Observation 5a9be03b-020e-41a3-9b34-421110aa12fb · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.299174Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.510945Z digest=sha256:43cfed1352be8d651aab63046823897a032a15ff5f39598e359bcf9359c00b8d

Observation 82a47b6f-2838-4763-95c5-5382dddf54a7 · outbound

This paper cites Qwen2.5 Technical Report.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Qwen2.5 Technical Report

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.515642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.515642Z digest=sha256:90f3ff42314b1a31ed23fada2a577016cb2bbd6e7795e640d5e40e8272675545

Observation a9a73950-9e81-4df9-97c0-d657ab55938b · outbound

This paper cites Cohen, Ruslan Salakhutdinov, and Christopher D.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Cohen, Ruslan Salakhutdinov, and Christopher D

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.520686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.520686Z digest=sha256:a2993d9e95f7f7a74c3398135908c0c480eebc3a7be60810d4b29f5ce0b983d0

Observation 274306c3-fb9d-4eaf-9901-3a7d595e016f · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 43

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.281471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.525537Z digest=sha256:8a458e57b6f80239b9df8e9431462273038601d2f526500d67b2fbe40bf18536

Observation 2f4f4220-882a-42d8-b558-e67ea766ce81 · outbound

This paper cites ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.531319Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.531319Z digest=sha256:3c181d91ab4b35567842b70e693d3cfba68a164451650b11a9d458c2fdcb1047

Observation eb7b1617-4827-4063-a3b5-eef1198cf550 · outbound

This paper cites Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T10:54:30.536308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T10:54:30.536308Z digest=sha256:ed64d47e3e9b5278c86d80be4ad3861011da896c9b6613a53c9be975299ac378

Observation 49404bab-a40d-4d0f-8bac-a4fa4024a915 · outbound

This paper cites an unresolved cited work.

R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-07T10:54:31.263577Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-07T10:54:30.541560Z digest=sha256:84098a264d2e4b7b1861e53ba2fccbc3bb41bb6e0d4db2fac4a90433cadd94f5

Pith citing papers

Observation a035ada7-ce11-4bbb-8836-820e9b7b309f · inbound

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning cites this paper.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.793725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.793725Z digest=sha256:047e2ee2ac1958ac1a79ba9966255ff5c2a774c7104af8935e6b31a57d26b1ba

Observation e1aa069b-9b7b-46a1-aba8-ddf010ed2d6b · inbound

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs cites this paper.

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-18T11:11:18.237838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-18T11:06:20.058342Z digest=sha256:8990e18cac23c5d499daa244d1b007a1adffca1aa351f5cfb91fdca5fd216f38

Observation a70854fa-5586-4614-b096-b05e0ba3d765 · inbound

Learning to Trust: Dynamic Utilization of Retrieval-Augmented Generation for E-commerce Search Relevance cites this paper.

Learning to Trust: Dynamic Utilization of Retrieval-Augmented Generation for E-commerce Search Relevance R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-18T08:11:07.182204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-18T08:06:23.479875Z digest=sha256:8cc511347e29d04b8f87002bdb388132e2b5d69cd2438cefdf15c1c4e589e5df

Observation 6f35d705-251a-4281-a182-3841362f4f59 · inbound

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation cites this paper.

Beyond Correctness: Rewarding Faithful Reasoning in Retrieval-Augmented Generation R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-04T09:50:51.764147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T09:50:51.764147Z digest=sha256:e3bda408051bc3fe96e2f613592fbdfef2f11ded3e6ec09a4fc71c700136321f

Observation 84164662-8da3-46e0-b4b5-be266237471d · inbound

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG cites this paper.

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 50

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:01:12.182325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-08T10:27:00.257353Z digest=sha256:568afb8cc3212efa56270a1e1f1223b8b351297306b74659f01bc5c40d836fd1

Observation 7f9edbd2-78df-4063-88ba-511dbfaa9a57 · inbound

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning cites this paper.

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:06:33.516677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-12T03:45:06.199636Z digest=sha256:0f44ed43e7c2902d0b8151c057fc8a96d505c5b566f311b8e8a2e2c9d170d767

Observation a8f2398a-4187-4976-af04-f952f24d8fdf · inbound

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning cites this paper.

Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 74

Resolution
verified exact
arxiv_id, observed 2026-05-20T22:23:48.394171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T22:19:49.016156Z digest=sha256:d55266cc2fb945d67ca2d19a9995d3e2385855dda3deb9e09bf8674d671041f8

Observation 8c269676-9853-4254-ae24-6187fab04f09 · inbound

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning cites this paper.

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T12:53:27.006970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-29T12:43:58.323948Z digest=sha256:e6d053a6b7e8d4d75b4d465f5dba3f65d49d482097494a4a918e6f29862760a1

Observation 48e413c0-87bf-409f-9bd6-e0dcad6295ec · inbound

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning cites this paper.

C-MIG: Multi-view Information Gain-based Retrieval-Augmented Generation for Clinical Diagnosis Reasoning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T05:01:11.073781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T05:01:11.073781Z digest=sha256:6660e4699dcd95999c3b2d9a9163ce7884798d179b7fef8f77f06e3364ede2cd

Observation ff0c6177-c78e-43ad-b05b-23eb7ce5d77b · inbound

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents cites this paper.

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-07-04T06:19:38.665573Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-26T14:33:50.123077Z digest=sha256:a34c68c568e7f715cf85ba1800f2d02ba5ce0f7096b5eb12167d333546aa2b28

Observation 018f5e59-856c-457f-8186-0402c437d89f · inbound

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents cites this paper.

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T10:43:55.436888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T10:43:55.436888Z digest=sha256:06a1f2f3b9a0a2826a9eefa4a7e6bc6864abb86352cf6f95978aee597b427ec4

Observation 0ee5da9b-6551-4441-a027-aeaa9de77755 · inbound

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents cites this paper.

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 72

Resolution
metadata mismatch
arxiv_id, observed 2026-06-29T12:53:26.535103Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-29T12:50:16.625077Z digest=sha256:ef1aae5705a71797fb3e1b6fd3919c0041bbe48879f2645007c9d63fdef2008e

Observation 4edeba9a-bc41-4575-8bbc-4c477388e225 · inbound

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning cites this paper.

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-01T13:54:23.891567Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T13:54:23.891567Z digest=sha256:f7791683f53d6f0b538f9de16433a665aa3f0f94894cffcd867a47225311f91d

Observation 3e83d5df-5c7a-45e8-9376-d24c1ef67354 · inbound

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents cites this paper.

Fetch-then-Explore: Decoupling Selection from Extraction over a Persistent Workspace for Search Agents R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 104

Resolution
unresolved
no resolver link, observed 2026-08-04T15:12:55.776464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T15:12:55.776464Z digest=sha256:d23d62ee7dc3960d13ce2be2bb5c83969215a2f9e1cdb5d5380b50342f095625