Pith. sign in

Paper Citation Record · LEDGER

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning

As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 7 inbound Pith citation observations for arXiv:2508.09303.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.09303 v1

Coverage vector

measured 43 of 43 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T21:12:12.793725Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 7 of 7 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T16:00:11.440671Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-28T22:32:44.029593Z

Reference resolution

43 of 43 outbound references displayed

  • verified exact0
  • verified fuzzy23
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7f254660-1248-4545-8767-f6d6303d4f1e · outbound

This paper cites GPT-4 Technical Report.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:10.149968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:10.149968Z digest=sha256:75d6cd1c242f8a76a552cfd84871ddbff581301fb2f32ecefb3a0d695c82bc1c

Observation 61f23d39-ef57-499b-bc83-f6391a3f148f · outbound

This paper cites Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:17.666111Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:10.265720Z digest=sha256:3c45c3a7a81942e99df9399303ac8828c45c6e5fad2489b00875ec576337ab58

Observation 60debba3-24aa-4666-9f1f-d21fd3254f03 · outbound

This paper cites A review of factors influencing user satisfaction in information retrieval.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning A review of factors influencing user satisfaction in information retrieval

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:17.330163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:10.330610Z digest=sha256:08db6e97d824dd24bcb84979d495816aecd17d28ec7943717e9155e6f2a75a75

Observation 9cf214fc-bd03-4f87-b810-6759d0682650 · outbound

This paper cites The Llama 3 Herd of Models.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning The Llama 3 Herd of Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:10.409056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:10.409056Z digest=sha256:92a2d20a6aff7fd03244f738d3d402896f65e14f875a08b395c12133e56e75ca

Observation 926ad8e5-0928-40fc-98fd-ff6f831f0d3b · outbound

This paper cites Retrieval-Augmented Generation for Large Language Models: A Survey.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Retrieval-Augmented Generation for Large Language Models: A Survey

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:10.477639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:10.477639Z digest=sha256:b7e32339e86a5d1839328e59e07439626a9a72cd2bce6438d80d390d66ff35be

Observation 2e51088c-9156-452a-8866-ac64a9521b25 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:10.565175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:10.565175Z digest=sha256:1997f56ba9496c9aa954c646de9040318f4ed55260e5b5084644441f34999efd

Observation 6ab708f3-dc0f-46a0-8c7d-86458547d365 · outbound

This paper cites Retrieval augmented language model pre-training.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Retrieval augmented language model pre-training

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:17.102872Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:10.645837Z digest=sha256:320150c09ac09615992756f785eceee1b29799c786f09b9783f6238a7a5428cc

Observation 26e37146-a3b6-4175-ba2c-26680d9e7982 · outbound

This paper cites Constructing A multi-hop QA dataset for comprehensive evaluation of reasoning steps.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Constructing A multi-hop QA dataset for comprehensive evaluation of reasoning steps

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:16.861437Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:10.710959Z digest=sha256:730e9000333f2346267e6696f310bfdcddf0a97efa56e99065ea78390bd73c62

Observation c7e6ef23-f227-443f-aa1e-de78ad7f9904 · outbound

This paper cites ORPO: monolithic preference optimization without reference model.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning ORPO: monolithic preference optimization without reference model

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:16.593997Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:10.741836Z digest=sha256:f54289983904e74bcbc58a4400f1786454ef8560869394051548e1bbb2817026

Observation 7a300d47-82ef-406e-89b7-5e75e66634e9 · outbound

This paper cites Survey of hallucination in natural language generation.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Survey of hallucination in natural language generation

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:16.354547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:10.773407Z digest=sha256:01de658dd30e747fabc9006c3b672e2a46a01aac356fe75f2eab1eb367d38c7d

Observation afe7e04b-abae-4a2b-96fd-ebc3a778285c · outbound

This paper cites an unresolved cited work.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-05T21:12:16.098728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:10.826331Z digest=sha256:97c8ddaf2d912ac0ad5bf5f3ab68a312d854875b01a98274aebe58cc3c8d7c4e

Observation d6e171a5-39d2-41d1-aa9d-37d2404192fc · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:10.890698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:10.890698Z digest=sha256:c1c524c71f4a2e9cc3f34a706511b27402f1c5a64ec546fdc2dd92ab1d4fc3f9

Observation 2aa8d116-1426-4df6-b0c9-70faad697aa7 · outbound

This paper cites Weld, and Luke Zettlemoyer.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Weld, and Luke Zettlemoyer

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:15.848643Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:10.958980Z digest=sha256:e1dc087051fc08618cf217c87a46d131958c22dd3b03090786e97dbc1aab5545

Observation 38f07e05-e737-479d-8b23-f5f8e54beeb0 · outbound

This paper cites Dense passage retrieval for open-domain question answering.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Dense passage retrieval for open-domain question answering

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:15.722055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.008903Z digest=sha256:661fbdfdbefb229311f3beed35589cab32f19beff755f2ab617fe73de3d6b39a

Observation 85cf4b4f-2a8f-42ac-ac19-09a0614378ef · outbound

This paper cites A survey of reinforcement learning from human feedback.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning A survey of reinforcement learning from human feedback

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:11.064527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:11.064527Z digest=sha256:a592de5adee099b3500b0031ce4d38e8e45902161b86bce3b0e6b5183b1e3c2b

Observation 499862f2-3f98-46d6-9e1f-15841e55680a · outbound

This paper cites Parikh, Chris Alberti, Danielle Epstein, Illia Polosukhin, Jacob Devlin, Kenton Lee, Kristina Toutanova, Llion Jones, Matthew Kelcey, Ming - Wei Chang, Andrew M.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Parikh, Chris Alberti, Danielle Epstein, Illia Polosukhin, Jacob Devlin, Kenton Lee, Kristina Toutanova, Llion Jones, Matthew Kelcey, Ming - Wei Chang, Andrew M

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:15.594794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.160381Z digest=sha256:96548cc7426138554c38e9214a424eb79367d0567b2811c5fb5a47dde48284bb

Observation 3733b631-9114-4e2c-bd79-634a9bc85621 · outbound

This paper cites Miranda, Bill Yuchen Lin, Khyathi Raghavi Chandu, Nouha Dziri, Sachin Kumar, Tom Zick, Yejin Choi, Noah A.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Miranda, Bill Yuchen Lin, Khyathi Raghavi Chandu, Nouha Dziri, Sachin Kumar, Tom Zick, Yejin Choi, Noah A

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:15.477053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.216923Z digest=sha256:b98f39cbf987f1e106200e9ebf6858e257d049d988d0f73b7b53bb3175ed4161

Observation 76aff35a-0537-44c0-b9bd-34f2948e9609 · outbound

This paper cites Large language models in finance: A survey.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Large language models in finance: A survey

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:15.303679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.274785Z digest=sha256:55a108e26b6e1990c396d8e3b8227b15dba72deb8a72f94220e5935f9cad402b

Observation 40799862-6eab-41dd-9159-cb04c7eeef93 · outbound

This paper cites When not to trust language models: Investigating effectiveness of parametric and non-parametric memories.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning When not to trust language models: Investigating effectiveness of parametric and non-parametric memories

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:15.155608Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.328199Z digest=sha256:a874ed307399ba2136abd273b9fd13248487a12e6f3ffdc6879b1fd0ffb560a4

Observation db71740e-3dcd-4e2e-9a94-e4126188259d · outbound

This paper cites O$^2$-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning O$^2$-Searcher: A Searching-based Agent Model for Open-Domain Open-Ended Question Answering

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:11.380262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:11.380262Z digest=sha256:90da8e9140fd4d9bd29a4ab2ad66333f7ba242c944c2aae9b7643b8974e6597d

Observation dd37ca0f-46cc-4136-87e3-e5f3dc0f416d · outbound

This paper cites Simpo: Simple preference optimization with a reference-free reward.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Simpo: Simple preference optimization with a reference-free reward

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:14.987611Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.469102Z digest=sha256:2f4347ac32825c5314b531f2820466ce01908d4d8f6cc8ca193e0a4421fb046c

Observation d2c768b6-3469-4726-a7d1-178707bc66ec · outbound

This paper cites an unresolved cited work.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-05T21:12:14.854532Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.531717Z digest=sha256:0fc243f35b2d17b3675391c9ae0751f5a7ebb53c3ef4ef748362da19fa532036

Observation c510312e-8ad1-4642-9804-b8d81dcab088 · outbound

This paper cites Iterative reasoning preference optimization.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Iterative reasoning preference optimization

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:14.620173Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.614989Z digest=sha256:d7a4fa52a78519d8f3f5a1a0fcafec1e51dd73acef597306e19b4023fed9e159

Observation 88087109-df13-4f68-9096-5b191e5b10e7 · outbound

This paper cites Smith, and Mike Lewis.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Smith, and Mike Lewis

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:14.444756Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.660534Z digest=sha256:643b55450c71d565365eefa845add92ae858a4dcba7728a583ea38ccfdecd5c2

Observation 0f20ea70-41b3-4e1d-ad52-84df737196e9 · outbound

This paper cites Manning, Stefano Ermon, and Chelsea Finn.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Manning, Stefano Ermon, and Chelsea Finn

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:14.294887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.710877Z digest=sha256:f92d254f2a8afb446fc08c53e2a702bacd6695bf2ef0fbf2ecd8e1d5fea778dc

Observation 9fe1ab6b-48d0-449b-8029-bcf0917ca917 · outbound

This paper cites Toolformer: Language models can teach themselves to use tools.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Toolformer: Language models can teach themselves to use tools

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:14.082981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.771234Z digest=sha256:7b93aef1f411268dddbee325199dee2d888d40e3c9cc3d3074854a49aeaafe75

Observation 81d2ab38-8b65-413e-8d7a-fe17069685e5 · outbound

This paper cites Proximal Policy Optimization Algorithms.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:11.811800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:11.811800Z digest=sha256:5d5f404032ca015f47b345e92a07dbc384d1668bfad701d71360e33c5365e176

Observation 2adda67e-b61d-4bfa-a97b-07329c450e82 · outbound

This paper cites Spurious Rewards: Rethinking Training Signals in RLVR.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Spurious Rewards: Rethinking Training Signals in RLVR

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:11.863783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:11.863783Z digest=sha256:0eb54cafd5c014cfc59f4ef57d080b38d24c97bbcd7eafe3470b968d803ba899

Observation 64186f76-6f6c-4130-a97c-02440d495a05 · outbound

This paper cites ZeroSearch: Incentivize the Search Capability of LLMs without Searching.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning ZeroSearch: Incentivize the Search Capability of LLMs without Searching

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:11.902466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:11.902466Z digest=sha256:260729ef3c43b8f811e958e79881c6e88504cb07d6bd9debdb3782a912d21305

Observation f3fca3a1-431d-40fe-a749-5676a5df1ae8 · outbound

This paper cites Sutton and Andrew G.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Sutton and Andrew G

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:13.926922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:11.938138Z digest=sha256:b765bf98390d472822ebf58a27592fb8672ade3c105c2718504dd7cffdb5060e

Observation 6d2d5a50-a4e4-4e37-bc26-1ccd91cc38aa · outbound

This paper cites Multihop- RAG : Benchmarking retrieval-augmented generation for multi-hop queries.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Multihop- RAG : Benchmarking retrieval-augmented generation for multi-hop queries

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:13.800825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:12.022501Z digest=sha256:85a53a10e2b2e4323b37fa1e17d8ad28ad9bbb526f5d647b44d0d7861f7ad812

Observation 0b75f438-f758-478e-99dc-a32f4f18f262 · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Gemini: A Family of Highly Capable Multimodal Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.111745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.111745Z digest=sha256:00792b8fd50b0fbde77f527beeff82fb4cb030c4c7edd8f515f71ff8700d61f4

Observation 2a37d315-32e8-4778-82d9-7287715f7736 · outbound

This paper cites Musique: Multihop questions via single-hop question composition.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Musique: Multihop questions via single-hop question composition

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:13.698662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:12.171420Z digest=sha256:e0fae294cbe6146f80c8bba299259f98e114395a108dea23a12345f3b51ec48b

Observation c3f928e5-172d-4496-8e0e-f6a3ea73ec76 · outbound

This paper cites Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:13.509777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:12.220676Z digest=sha256:6a1a77d8e52c47ffe38be36778adbd6df5b3d39a004939e8c2d2af92d91a6ffb

Observation d89a6b42-e2b5-4355-8559-36edbc6133c3 · outbound

This paper cites Acting Less is Reasoning More! Teaching Model to Act Efficiently.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Acting Less is Reasoning More! Teaching Model to Act Efficiently

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.308929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.308929Z digest=sha256:f93a5a5e0ddedf526c62d890c35b39315b4d02703513dab1863cadfb8cf784a2

Observation 8cdbb16b-0648-4682-840d-c6757cefeb33 · outbound

This paper cites Text Embeddings by Weakly-Supervised Contrastive Pre-training.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Text Embeddings by Weakly-Supervised Contrastive Pre-training

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.389009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.389009Z digest=sha256:9a5749a494649a28e01786eaf1321b15f0a8062baa3acf2ad309e16ab63d226c

Observation 82c3f128-cd6b-4ca1-b174-dfc382795218 · outbound

This paper cites StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning StepSearch: Igniting LLMs Search Ability via Step-Wise Proximal Policy Optimization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.451731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.451731Z digest=sha256:acce070423a91356b05dbb245d7c9d647d7d4fd00141be99ce2a7519e73f8a80

Observation 84dd0aec-2dac-43c6-b372-30f4b55a0925 · outbound

This paper cites Reasoning or memorization? unreliable results of reinforcement learning due to data contamination.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Reasoning or memorization? unreliable results of reinforcement learning due to data contamination

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.500175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.500175Z digest=sha256:be926338a086e41425fcb7af48530ca38c61c85f9bd4712308565006cfddcd71

Observation dc6a072b-c9c2-460c-8d00-ee5ef2d0a98b · outbound

This paper cites MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.567646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.567646Z digest=sha256:700e5dcc86899eacd458756342cd2ed8a6b3fd32be6ac7cc801bec5652430849

Observation 8b525432-1de0-4413-ac36-c9212bd25ad7 · outbound

This paper cites Qwen2.5 Technical Report.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Qwen2.5 Technical Report

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.658091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.658091Z digest=sha256:e66fe2f0f244b1ca5de54b99ba1c580cbf93e6225cec29dc6a75824ec4fa9436

Observation 64153c56-4968-433a-b4d7-a68af4fd5931 · outbound

This paper cites Cohen, Ruslan Salakhutdinov, and Christopher D.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Cohen, Ruslan Salakhutdinov, and Christopher D

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:13.389477Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:12.715033Z digest=sha256:5adc93262bd6555c6355bb4b39a7c451accda64c6ce266d4c88fb8febff24b57

Observation 549c28d9-061a-40bb-a086-9bd47816549a · outbound

This paper cites Narasimhan, and Yuan Cao.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning Narasimhan, and Yuan Cao

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T21:12:13.239715Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-05T21:12:12.760593Z digest=sha256:d55fa784fc1bcc7325ec9e2ef07c4372476f0f1000eef968a26b426209acf26c

Observation a035ada7-ce11-4bbb-8836-820e9b7b309f · outbound

This paper cites R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning.

ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning R-Search: Empowering LLM Reasoning with Search via Multi-Reward Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T21:12:12.793725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:12:12.793725Z digest=sha256:c14b8a5cd25234939690e83c7057ea3f6caf89b4492a8001b252360639d6425c

Pith citing papers

Observation 66d5ae84-a72a-457b-a78b-f5679185acc6 · inbound

Hybrid Deep Searcher: Scalable Parallel and Sequential Search Reasoning cites this paper.

Hybrid Deep Searcher: Scalable Parallel and Sequential Search Reasoning ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T16:00:11.440671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T16:00:11.440671Z digest=sha256:6370af8f1a9826fdca51451786038a1cd966ccf1775f65acfec4511c1f73502e

Observation 74f3c35a-f61f-4efb-a4ee-568e19fcdf03 · inbound

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs cites this paper.

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-18T11:11:18.137585Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-18T11:06:20.058342Z digest=sha256:1e8cde2b4797ff74e5374a1e296af3ad71680f999dc8b3a4a37cb5132732e75e

Observation 5d40a41f-8c7f-4ca1-bec9-e8442c3461bc · inbound

Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning cites this paper.

Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-17T01:13:47.974701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-17T01:11:26.411893Z digest=sha256:d3d50f45b8748829ce5faba983d049b492b36d88d57ecb28c9414de94faa8eac

Observation e0200f79-ff96-474c-947e-e6565d15f8f8 · inbound

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG cites this paper.

LatentRAG: Latent Reasoning and Retrieval for Efficient Agentic RAG ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:01:12.210309Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-08T10:27:00.257353Z digest=sha256:d559dda4fbeee905f9db3e66db722e13d1480489f02e12c120f3a013f5631303

Observation 4ea68c04-6587-46e0-964f-045f83cba423 · inbound

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents cites this paper.

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-11T01:45:52.310629Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-11T01:28:36.266167Z digest=sha256:93c112aa5b5c3b74971e4839d10da83d8202a3d8bcf08cf5b0faa7055b042898

Observation b5213207-8b55-42ad-bdcb-e74528680afa · inbound

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents cites this paper.

HyperEyes: Dual-Grained Efficiency-Aware Reinforcement Learning for Parallel Multimodal Search Agents ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-12T03:21:19.032968Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-12T03:18:01.006274Z digest=sha256:ed194de3616ff2e2c14270a45a12ff0df47db52da67175d370d1d6047513b529

Observation c1b3fcab-7c07-4700-a910-7f540d833870 · inbound

Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward cites this paper.

Planner-Centric Reinforcement Learning for Deep Research with Structure-Aware Reward ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-06-28T22:32:44.031157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-06-28T22:30:00.735630Z digest=sha256:eae45e13e0c720e6864700343af8062a4280d9d6d22a0adf4e9cfa3afc31b444