Pith. sign in

Paper Citation Record · LEDGER

Reinforcement Learning Enhanced LLMs: A Survey

As of 12 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 23 inbound Pith citation observations for arXiv:2412.10400.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.10400 v3

Coverage vector

measured 17 of 17 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T21:35:40.574361Z

measured 40 of 40 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 23 of 23 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T20:25:49.495121Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T07:59:40.174737Z

Reference resolution

17 of 17 outbound references displayed

  • verified exact0
  • verified fuzzy2
  • unresolved15
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 27db8dcf-9948-41e6-8d5f-d3462c38d0c5 · outbound

This paper cites an unresolved cited work.

Reinforcement Learning Enhanced LLMs: A Survey Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-11T21:35:40.956544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T21:35:40.480709Z digest=sha256:a6396ede1c5225d9de564a50eb9f69190eb7bc84718e7c966670c7f6e779e93d

Observation e319d989-f2ec-48c5-bf75-d956c16eb449 · outbound

This paper cites Safe RLHF: Safe Reinforcement Learning from Human Feedback.

Reinforcement Learning Enhanced LLMs: A Survey Safe RLHF: Safe Reinforcement Learning from Human Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.499560Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.499560Z digest=sha256:a6c65f0014c510584f9f079d611646f8ad6ccb8a2e7b154307803443774eea54

Observation 8e0201da-1fee-46be-af60-0fc4661762b7 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Reinforcement Learning Enhanced LLMs: A Survey Measuring Massive Multitask Language Understanding

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.505745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.505745Z digest=sha256:474b32b2b21b16c09ee95fddeb223e89c06b60374290a2844c93d39ea7b352e9

Observation 95b169d5-5b4d-4a73-9dff-398e3d33c0f8 · outbound

This paper cites Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive.

Reinforcement Learning Enhanced LLMs: A Survey Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.518271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.518271Z digest=sha256:3c7e7f0e3080889cd9bb1d46646e5f4ea8db6abd52815218c3386bd68c652a82

Observation 6b838e3f-179b-4ba1-92ce-a13b8b4b7aae · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

Reinforcement Learning Enhanced LLMs: A Survey GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.526148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.526148Z digest=sha256:e23e9da632f083f03578bae32c352a8f020cbcbe2d089839b6d7e950b021ae00

Observation 71e37cb4-4b6b-4d46-9009-dde5ef25a02f · outbound

This paper cites Offline Regularised Reinforcement Learning for Large Language Models Alignment.

Reinforcement Learning Enhanced LLMs: A Survey Offline Regularised Reinforcement Learning for Large Language Models Alignment

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.531764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.531764Z digest=sha256:a85a57a6efad4ee1ae33c0a5fd1c3bf21e09fa4adbd868c2ab7051cd40b29e5c

Observation cc514ce4-a699-4554-b0d5-1b7bb0373295 · outbound

This paper cites Trust Region Policy Optimization.

Reinforcement Learning Enhanced LLMs: A Survey Trust Region Policy Optimization

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.539146Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.539146Z digest=sha256:82c556b4368990b715863b85365011a2f58479bbdf0a11db102f759c807847f8

Observation d5c58bac-fb8a-45fa-953e-42daf99d473c · outbound

This paper cites Hermes 3 Technical Report.

Reinforcement Learning Enhanced LLMs: A Survey Hermes 3 Technical Report

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.545320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.545320Z digest=sha256:db6edf1db7360cfcac0ad75cb843706eb956cccc2bd9c85d204b63050c419797

Observation 489ceb53-3326-4934-8d8c-8f5a0b5f8a0c · outbound

This paper cites GPT-RE: In-context Learning for Relation Extraction using Large Language Models.

Reinforcement Learning Enhanced LLMs: A Survey GPT-RE: In-context Learning for Relation Extraction using Large Language Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.550760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.550760Z digest=sha256:be06cddbc65bfe7c3707c4fcde4f34d5f5abcc5a1cc0aa63936914499558e97c

Observation 3218ad23-1b29-47f6-9aaf-f30ce1da30d0 · outbound

This paper cites Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study.

Reinforcement Learning Enhanced LLMs: A Survey Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.557007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.557007Z digest=sha256:f87e9861613f0553692626e3378e81d47954771f1696b96153e08c03bde35957

Observation dfa7c9b3-ad48-4846-bc8e-fff4bb6ecaa6 · outbound

This paper cites Advances in Neural Information Processing Systems, 36.

Reinforcement Learning Enhanced LLMs: A Survey Advances in Neural Information Processing Systems, 36

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T21:35:40.915069Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T21:35:40.564159Z digest=sha256:9960c1d7c531bb9b9d4dd5d695c6c14f1f67765c339cc928bb8d9824e7e3f1cc

Observation 65ed0f96-370a-4e77-85e7-397bfd35c7b2 · outbound

This paper cites Beyond Scalar Reward Model: Learning Generative Judge from Preference Data.

Reinforcement Learning Enhanced LLMs: A Survey Beyond Scalar Reward Model: Learning Generative Judge from Preference Data

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.569414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.569414Z digest=sha256:831cca1f23aa3a09a71bf9d72614d65d17000c65791ba9cb0bc83c3a7de4b7c3

Observation 970770b0-3351-4624-a1ef-9abac2dae911 · outbound

This paper cites Self-Rewarding Language Models.

Reinforcement Learning Enhanced LLMs: A Survey Self-Rewarding Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.574361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.574361Z digest=sha256:3d9d6e5eabe543af3c65235759c5b8556fbef2ce3e677d4910fdacd5ff751e3d

Observation fdfe058d-08d5-45cd-ace6-287bc3b5dc85 · outbound

This paper cites InternLM2 Technical Report.

Reinforcement Learning Enhanced LLMs: A Survey InternLM2 Technical Report

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.492631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.492631Z digest=sha256:2aaf990d14b414b68300d2f4f3fb7329b00741aca04bc25dd3a177d0c004b005

Observation 0f320d50-01f0-4a8b-aa17-cd9254453f80 · outbound

This paper cites Advances in neural in- formation processing systems, 35:27730–27744.

Reinforcement Learning Enhanced LLMs: A Survey Advances in neural in- formation processing systems, 35:27730–27744

Reference 2022

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T21:35:40.936926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-11T21:35:40.513084Z digest=sha256:ac01698a965beb9be7ad49b5b11843bc7d807f899f13e0006233a5dd0655402a

Observation ad7991c2-d0b6-442f-b2ed-30c6ff32e201 · outbound

This paper cites Concrete Problems in AI Safety.

Reinforcement Learning Enhanced LLMs: A Survey Concrete Problems in AI Safety

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.486417Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.486417Z digest=sha256:ee66ab013ab04cad9b56f54d9256d107d200c47acfb2b03eb016eb85f666e815

Observation c9a35d03-0ee0-41db-8953-7285334545d4 · outbound

This paper cites Nemotron-4 340B Technical Report.

Reinforcement Learning Enhanced LLMs: A Survey Nemotron-4 340B Technical Report

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-11T21:35:40.474492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:35:40.474492Z digest=sha256:67c87bd3185d78b33f5895f4ada95ada932697309becdb5864b103916faf8856

Pith citing papers

Observation 03a804e4-8548-4dcf-a4d6-4073a43b8907 · inbound

Adaptive Graph of Thoughts: Test-Time Adaptive Reasoning Unifying Chain, Tree, and Graph Structures cites this paper.

Adaptive Graph of Thoughts: Test-Time Adaptive Reasoning Unifying Chain, Tree, and Graph Structures Reinforcement Learning Enhanced LLMs: A Survey

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-08T20:25:49.495121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T20:25:49.495121Z digest=sha256:d27d95ac017f9aad76c7072c67c11707e40e17a740439a69c76b32cdab431133

Observation 3b203e7a-088c-4dbc-b3f4-92ca1cebad40 · inbound

Three Minds, One Legend: Jailbreak Large Reasoning Model with Adaptive Stacked Ciphers cites this paper.

Three Minds, One Legend: Jailbreak Large Reasoning Model with Adaptive Stacked Ciphers Reinforcement Learning Enhanced LLMs: A Survey

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T15:08:12.936464Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:08:12.936464Z digest=sha256:a191f9fd9dfc2a195a81ca983fc63949519ad03b768bdb4170728b4f94dea41d

Observation 74c35b06-33bc-4769-a41d-ee2412b33a4e · inbound

RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models cites this paper.

RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models Reinforcement Learning Enhanced LLMs: A Survey

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T11:21:39.153862Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:21:39.153862Z digest=sha256:cbab2ac0db3ffe8f19bf92f5f06708ee908e5b2acf25ca7d26a858e3bed87929

Observation b3f198b2-d25f-4a79-afe5-066bbddecdb4 · inbound

Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance cites this paper.

Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance Reinforcement Learning Enhanced LLMs: A Survey

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T10:19:34.611764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:19:34.611764Z digest=sha256:92ffc0e37e632c1e7394e904879283984cecd098b7d6e9239e1f1038f64edad3

Observation 271c3ef1-143a-4feb-a781-27cf896f307c · inbound

From Emergence to Control: Probing and Modulating Self-Reflection in Language Models cites this paper.

From Emergence to Control: Probing and Modulating Self-Reflection in Language Models Reinforcement Learning Enhanced LLMs: A Survey

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T01:03:40.631750Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T01:03:40.631750Z digest=sha256:241c055c3f53d8bb6cfbce39e98fa864bc52bbd62cad0b7489c46807f14bca07

Observation 92ac68ef-15bb-45df-83c8-f1635466a8a7 · inbound

Graphs Meet AI Agents: Taxonomy, Progress, and Future Opportunities cites this paper.

Graphs Meet AI Agents: Taxonomy, Progress, and Future Opportunities Reinforcement Learning Enhanced LLMs: A Survey

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T23:26:45.293601Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:26:45.293601Z digest=sha256:781d46afc59bdfb6964861d89f9d2ac3da202450b574f2efc3220d602c3dad01

Observation 8d61cdcc-f5b3-4f50-ac9f-63d1b5addaf0 · inbound

A Technical Survey of Reinforcement Learning Techniques for Large Language Models cites this paper.

A Technical Survey of Reinforcement Learning Techniques for Large Language Models Reinforcement Learning Enhanced LLMs: A Survey

Reference 101

Resolution
unresolved
no resolver link, observed 2026-08-06T19:59:35.032860Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:59:35.032860Z digest=sha256:a4ecc8c11c1a4b4315195404b98036df78ebbb24b36f2ce742f6af53949decfe

Observation 4ac75bcc-2484-4701-8ee5-7d2205ab938f · inbound

UrbanMind: Towards Urban General Intelligence via Tool-Enhanced Retrieval-Augmented Generation and Multilevel Optimization cites this paper.

UrbanMind: Towards Urban General Intelligence via Tool-Enhanced Retrieval-Augmented Generation and Multilevel Optimization Reinforcement Learning Enhanced LLMs: A Survey

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-06T19:45:56.908088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:45:56.908088Z digest=sha256:6fa05766313fdf87f8ecd9ef5afaa2dfdfc3781bff7e1f69c47f1aba613ec6be

Observation 8454d102-a1f9-4778-ac7f-ca29f592db15 · inbound

Prompt Informed Reinforcement Learning for Visual Coverage Path Planning cites this paper.

Prompt Informed Reinforcement Learning for Visual Coverage Path Planning Reinforcement Learning Enhanced LLMs: A Survey

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T17:39:45.167344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:39:45.167344Z digest=sha256:691d06e79fe032c45ea4d51aedf57aa43b6f66894b6b2f4da38c6439d417f6cb

Observation d8a03833-3369-49cf-b682-b4d1928c1d0b · inbound

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning cites this paper.

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning Reinforcement Learning Enhanced LLMs: A Survey

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T16:15:03.669635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:15:03.669635Z digest=sha256:b74cbbd04d1ad5902fe224144f11d596aa82b8b349f07e56b26dcb316ac196be

Observation c802a854-f512-4e56-88f1-ed39a82c88db · inbound

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey cites this paper.

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey Reinforcement Learning Enhanced LLMs: A Survey

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-18T19:21:48.875324Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-18T19:19:36.427337Z digest=sha256:1f81fbfc2beae9f0b947148393e375bef8b60d725e216e401a6c570e19180ec6

Observation 4337c025-72a6-4375-9146-b13ac84b2cc5 · inbound

AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models cites this paper.

AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models Reinforcement Learning Enhanced LLMs: A Survey

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T15:17:13.811953Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:17:13.811953Z digest=sha256:01262c0bbfbedf020dccdcd12c92b9dfd3a64977c232e3acdafcc5d2adcf1e0d

Observation 962487d1-4a09-403b-9316-9085a2f737fb · inbound

Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing cites this paper.

Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing Reinforcement Learning Enhanced LLMs: A Survey

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-04T20:49:37.841831Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T20:49:37.841831Z digest=sha256:ba243a47c355cae1dd591eaa9d6a69d05b5d0c4800d7428bab3965a59e54a1da

Observation 924608cf-7715-43ae-b943-b3fbfcb71f8a · inbound

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle cites this paper.

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle Reinforcement Learning Enhanced LLMs: A Survey

Reference 169

Resolution
unresolved
no resolver link, observed 2026-08-04T16:07:42.090072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:07:42.090072Z digest=sha256:8177ad484ba0ac5d0d1ea9b8a91c2525d0fc7981afaa100d0c2dbca452172b6e

Observation 1872373b-1b53-42ae-a144-2f468c9ec62b · inbound

ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning cites this paper.

ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning Reinforcement Learning Enhanced LLMs: A Survey

Reference 54

Resolution
verified exact
arxiv_id, observed 2026-05-11T06:41:41.576325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T17:29:34.145855Z digest=sha256:5917a008aee2476756833fefabbe15866134e0952ea2b03ae455617c71d8dce0

Observation bce1f1bb-2c66-4943-afcb-3754b3fa4315 · inbound

Rethinking Agentic Reinforcement Learning In Large Language Models cites this paper.

Rethinking Agentic Reinforcement Learning In Large Language Models Reinforcement Learning Enhanced LLMs: A Survey

Reference 92

Resolution
verified exact
arxiv_id, observed 2026-05-12T10:21:29.688214Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-07T06:30:09.945371Z digest=sha256:b3d6944d9d8776266f2f166ed3a0c2bd32e6e5a87c2c07df0e3624b980b94b90

Observation 97ae5a59-580d-44ff-afe6-7d7aa208166d · inbound

Rethinking Agentic Reinforcement Learning In Large Language Models cites this paper.

Rethinking Agentic Reinforcement Learning In Large Language Models Reinforcement Learning Enhanced LLMs: A Survey

Reference 92

Resolution
verified exact
arxiv_id, observed 2026-05-11T22:11:16.839688Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-08T03:12:19.414358Z digest=sha256:2ce53501b348f25c348dac43a059dfbcbb5b8c1278a75fae2d6763b15aa9d8c2

Observation 48e78007-5e78-49b1-a1c7-4e38121d42b0 · inbound

Rethinking Agentic Reinforcement Learning In Large Language Models cites this paper.

Rethinking Agentic Reinforcement Learning In Large Language Models Reinforcement Learning Enhanced LLMs: A Survey

Reference 92

Resolution
verified exact
arxiv_id, observed 2026-05-19T17:02:40.669713Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-19T16:58:41.558250Z digest=sha256:c7b5bc9db56575dd530d65c6bb45c06f3570bd3fc1451cb5667a421035fe6bbf

Observation 331828b8-536a-4a04-a4b7-0e41a4240678 · inbound

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning cites this paper.

Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning Reinforcement Learning Enhanced LLMs: A Survey

Reference 122

Resolution
verified exact
arxiv_id, observed 2026-05-10T23:15:48.880543Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=arxiv_source observed=2026-05-10T19:15:27.406778Z digest=sha256:3ae3fbb09a44cc66604132252fd96e2c8a7d1a78addde4b3f263f0e59a5bd5e7

Observation da193571-0479-4764-91d0-ae53fc401e22 · inbound

On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective cites this paper.

On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective Reinforcement Learning Enhanced LLMs: A Survey

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:36:26.836626Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-12T00:52:51.509014Z digest=sha256:eaef35147e7d2cde53f1c364978b0dd21f745b214aec5a5432a3639ffb997710

Observation bcf3352b-0cc0-411e-83c8-bc518ee2c6d2 · inbound

Distributed Direct Preference Optimization cites this paper.

Distributed Direct Preference Optimization Reinforcement Learning Enhanced LLMs: A Survey

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-05-21T05:59:40.940560Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-05-21T05:56:54.996304Z digest=sha256:19ccb2de0076bbc87e3f5b9df22986495bb3eb32e606b07d72d1b79df26058c1

Observation 51c7f75c-ae03-49f3-b4df-8b02fbed5ada · inbound

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs cites this paper.

Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs Reinforcement Learning Enhanced LLMs: A Survey

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-07-04T00:59:20.399088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-26T20:48:59.539626Z digest=sha256:486a41c9a67e6cb4579d95274f9a747d2fb8f1afaa63e3a9fe9849f43480d8b2

Observation a585e21d-8c8a-485a-9f16-1ca05051fd09 · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Reinforcement Learning Enhanced LLMs: A Survey

Reference 218

Resolution
verified exact
arxiv_id, observed 2026-07-04T07:59:40.176238Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:a4a1de3b04176560a930e13e4a6f9969046b1d9f6fec2c0205ea4d268ca0ef1e