Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-11T21:35:40.574361Z
Paper Citation Record · LEDGER
As of 12 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 23 inbound Pith citation observations for arXiv:2412.10400.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-11T21:35:40.574361Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-08T20:25:49.495121Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-04T07:59:40.174737Z
17 of 17 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 27db8dcf-9948-41e6-8d5f-d3462c38d0c5 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Unresolved cited work
Reference 1
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation e319d989-f2ec-48c5-bf75-d956c16eb449 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Safe RLHF: Safe Reinforcement Learning from Human Feedback
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8e0201da-1fee-46be-af60-0fc4661762b7 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Measuring Massive Multitask Language Understanding
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 95b169d5-5b4d-4a73-9dff-398e3d33c0f8 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6b838e3f-179b-4ba1-92ce-a13b8b4b7aae · outbound
Reinforcement Learning Enhanced LLMs: A Survey GPQA: A Graduate-Level Google-Proof Q&A Benchmark
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 71e37cb4-4b6b-4d46-9009-dde5ef25a02f · outbound
Reinforcement Learning Enhanced LLMs: A Survey Offline Regularised Reinforcement Learning for Large Language Models Alignment
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cc514ce4-a699-4554-b0d5-1b7bb0373295 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Trust Region Policy Optimization
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d5c58bac-fb8a-45fa-953e-42daf99d473c · outbound
Reinforcement Learning Enhanced LLMs: A Survey Hermes 3 Technical Report
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 489ceb53-3326-4934-8d8c-8f5a0b5f8a0c · outbound
Reinforcement Learning Enhanced LLMs: A Survey GPT-RE: In-context Learning for Relation Extraction using Large Language Models
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3218ad23-1b29-47f6-9aaf-f30ce1da30d0 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dfa7c9b3-ad48-4846-bc8e-fff4bb6ecaa6 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Advances in Neural Information Processing Systems, 36
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation 65ed0f96-370a-4e77-85e7-397bfd35c7b2 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Beyond Scalar Reward Model: Learning Generative Judge from Preference Data
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 970770b0-3351-4624-a1ef-9abac2dae911 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Self-Rewarding Language Models
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fdfe058d-08d5-45cd-ace6-287bc3b5dc85 · outbound
Reinforcement Learning Enhanced LLMs: A Survey InternLM2 Technical Report
Reference 2020
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0f320d50-01f0-4a8b-aa17-cd9254453f80 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Advances in neural in- formation processing systems, 35:27730–27744
Reference 2022
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation ad7991c2-d0b6-442f-b2ed-30c6ff32e201 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Concrete Problems in AI Safety
Reference 2023
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c9a35d03-0ee0-41db-8953-7285334545d4 · outbound
Reinforcement Learning Enhanced LLMs: A Survey Nemotron-4 340B Technical Report
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 03a804e4-8548-4dcf-a4d6-4073a43b8907 · inbound
Adaptive Graph of Thoughts: Test-Time Adaptive Reasoning Unifying Chain, Tree, and Graph Structures Reinforcement Learning Enhanced LLMs: A Survey
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3b203e7a-088c-4dbc-b3f4-92ca1cebad40 · inbound
Three Minds, One Legend: Jailbreak Large Reasoning Model with Adaptive Stacked Ciphers Reinforcement Learning Enhanced LLMs: A Survey
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 74c35b06-33bc-4769-a41d-ee2412b33a4e · inbound
RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models Reinforcement Learning Enhanced LLMs: A Survey
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b3f198b2-d25f-4a79-afe5-066bbddecdb4 · inbound
Efficient Online RFT with Plug-and-Play LLM Judges: Unlocking State-of-the-Art Performance Reinforcement Learning Enhanced LLMs: A Survey
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 271c3ef1-143a-4feb-a781-27cf896f307c · inbound
From Emergence to Control: Probing and Modulating Self-Reflection in Language Models Reinforcement Learning Enhanced LLMs: A Survey
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 92ac68ef-15bb-45df-83c8-f1635466a8a7 · inbound
Graphs Meet AI Agents: Taxonomy, Progress, and Future Opportunities Reinforcement Learning Enhanced LLMs: A Survey
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8d61cdcc-f5b3-4f50-ac9f-63d1b5addaf0 · inbound
A Technical Survey of Reinforcement Learning Techniques for Large Language Models Reinforcement Learning Enhanced LLMs: A Survey
Reference 101
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4ac75bcc-2484-4701-8ee5-7d2205ab938f · inbound
UrbanMind: Towards Urban General Intelligence via Tool-Enhanced Retrieval-Augmented Generation and Multilevel Optimization Reinforcement Learning Enhanced LLMs: A Survey
Reference 78
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8454d102-a1f9-4778-ac7f-ca29f592db15 · inbound
Prompt Informed Reinforcement Learning for Visual Coverage Path Planning Reinforcement Learning Enhanced LLMs: A Survey
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d8a03833-3369-49cf-b682-b4d1928c1d0b · inbound
CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning Reinforcement Learning Enhanced LLMs: A Survey
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c802a854-f512-4e56-88f1-ed39a82c88db · inbound
The Landscape of Agentic Reinforcement Learning for LLMs: A Survey Reinforcement Learning Enhanced LLMs: A Survey
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation 4337c025-72a6-4375-9146-b13ac84b2cc5 · inbound
AR$^2$: Adversarial Reinforcement Learning for Abstract Reasoning in Large Language Models Reinforcement Learning Enhanced LLMs: A Survey
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 962487d1-4a09-403b-9316-9085a2f737fb · inbound
Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing Reinforcement Learning Enhanced LLMs: A Survey
Reference 72
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 924608cf-7715-43ae-b943-b3fbfcb71f8a · inbound
Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle Reinforcement Learning Enhanced LLMs: A Survey
Reference 169
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1872373b-1b53-42ae-a144-2f468c9ec62b · inbound
ReRec: Reasoning-Augmented LLM-based Recommendation Assistant via Reinforcement Fine-tuning Reinforcement Learning Enhanced LLMs: A Survey
Reference 54
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation bce1f1bb-2c66-4943-afcb-3754b3fa4315 · inbound
Rethinking Agentic Reinforcement Learning In Large Language Models Reinforcement Learning Enhanced LLMs: A Survey
Reference 92
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation 97ae5a59-580d-44ff-afe6-7d7aa208166d · inbound
Rethinking Agentic Reinforcement Learning In Large Language Models Reinforcement Learning Enhanced LLMs: A Survey
Reference 92
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation 48e78007-5e78-49b1-a1c7-4e38121d42b0 · inbound
Rethinking Agentic Reinforcement Learning In Large Language Models Reinforcement Learning Enhanced LLMs: A Survey
Reference 92
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation 331828b8-536a-4a04-a4b7-0e41a4240678 · inbound
Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning Reinforcement Learning Enhanced LLMs: A Survey
Reference 122
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation da193571-0479-4764-91d0-ae53fc401e22 · inbound
On Distinguishing Capability Elicitation from Capability Creation in Post-Training: A Free-Energy Perspective Reinforcement Learning Enhanced LLMs: A Survey
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation bcf3352b-0cc0-411e-83c8-bc518ee2c6d2 · inbound
Distributed Direct Preference Optimization Reinforcement Learning Enhanced LLMs: A Survey
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation 51c7f75c-ae03-49f3-b4df-8b02fbed5ada · inbound
Generating Natural and Expressive Robot Gestures through Iterative Reinforcement Learning with Human Feedback using LLMs Reinforcement Learning Enhanced LLMs: A Survey
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.
Observation a585e21d-8c8a-485a-9f16-1ca05051fd09 · inbound
Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Reinforcement Learning Enhanced LLMs: A Survey
Reference 218
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.