Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-05T20:20:56.723685Z
Paper Citation Record · LEDGER
As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2508.10839.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-05T20:20:56.723685Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-05-13T06:44:28.552513Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-05-13T06:47:27.135925Z
43 of 43 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation cc974d6f-2720-497d-8179-7b6803162c93 · outbound
Reinforced Language Models for Sequential Decision Making , " * write output.state after.block = add.period write newline
Reference 1
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 6786b4fd-cb1d-4dfe-8e02-4f79bbaabca2 · outbound
Reinforced Language Models for Sequential Decision Making write newline
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9f7e173b-2edd-4965-82cb-0502505ecd5f · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a85edd25-c227-4cdc-a376-494d2f734fb4 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 4
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation fe43891f-efe5-4332-88fd-ba8d3b1a22d2 · outbound
Reinforced Language Models for Sequential Decision Making DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 211b3b15-0822-47f1-a202-816c7a2cd241 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 6331ee09-c3a0-4477-8cb5-3373dce81642 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation a35cd3c0-c1b6-4e4b-bdbb-680e44d431d2 · outbound
Reinforced Language Models for Sequential Decision Making A.; Bernstein, D
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation c16c6a00-d1fe-4f2f-a93f-369528e211ca · outbound
Reinforced Language Models for Sequential Decision Making T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8b7cefc6-3ed0-4b60-8b31-63ef294136ee · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 24b0cb18-55f0-4650-b89c-637c4f8ce916 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 928fb816-b6c9-4941-9b71-324f10ca7d27 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 8a8570bd-8a71-442c-b15f-4fe34a1b0797 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation d9191b20-4cca-4422-824f-2d124ffdc844 · outbound
Reinforced Language Models for Sequential Decision Making HMCF: A Human-in-the-loop Multi-Robot Collaboration Framework Based on Large Language Models
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a12a504d-2e2d-4c62-81a3-dd81429bcd31 · outbound
Reinforced Language Models for Sequential Decision Making Playing Atari with Deep Reinforcement Learning
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a2b58967-429c-4a92-99c2-94d717356c35 · outbound
Reinforced Language Models for Sequential Decision Making ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e3cdc1d5-b022-4c21-801d-868b5f0f3c3a · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 5d520b1a-4fe6-4431-a27a-8e6ab58e5c4c · outbound
Reinforced Language Models for Sequential Decision Making GPT-4o System Card
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 292b3ed9-5318-4fad-9e5d-8a22f21c988e · outbound
Reinforced Language Models for Sequential Decision Making L.; Mishkin, P.; Zhang, C.; et al
Reference 19
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 2086a6f9-418d-40f4-b5a4-18d3fbaad7c4 · outbound
Reinforced Language Models for Sequential Decision Making E.; Zhang, K.; and Kim, J.-K
Reference 20
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 71ab2df3-6d4c-4faa-acd8-83a998f305dd · outbound
Reinforced Language Models for Sequential Decision Making Qwen2.5 Technical Report
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0f2007e4-d43b-4ece-837b-84e0da47fcc6 · outbound
Reinforced Language Models for Sequential Decision Making D.; Ermon, S.; and Finn, C
Reference 22
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation a9c1cf07-8a3e-405c-80ad-0554d94eb40b · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation a4e8f578-d9bd-4c4e-9317-a8bbb40a3c05 · outbound
Reinforced Language Models for Sequential Decision Making Proximal Policy Optimization Algorithms
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 01358c47-70f4-42e0-908f-653b73d2922d · outbound
Reinforced Language Models for Sequential Decision Making DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c3d96199-7a37-41cf-8670-755e8fc51ade · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 9bbcb265-1e03-4565-aa61-613f49a04724 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 7685cd1e-7d05-46b8-90dd-410be04f9488 · outbound
Reinforced Language Models for Sequential Decision Making S.; and Barto, A
Reference 28
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation abc864c5-5297-4f6a-9b4b-d9f0d577812a · outbound
Reinforced Language Models for Sequential Decision Making Evaluation of Large Language Models for Decision Making in Autonomous Driving
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 89f3a3cf-3e89-4dfa-88ac-74780d480c2f · outbound
Reinforced Language Models for Sequential Decision Making Gymnasium: A Standard Interface for Reinforcement Learning Environments
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7dd9dd30-5aab-4cc1-9ac1-a8b1a95dda1a · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 31
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation dc262115-c184-4fe5-b0d6-36fa21ffa1a7 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 5f42ce11-bc78-47e2-af30-ec53f906a553 · outbound
Reinforced Language Models for Sequential Decision Making Reinforcement Learning for Reasoning in Large Language Models with One Training Example
Reference 33
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8aaccf3a-20ba-495a-88f2-cf358bd7790b · outbound
Reinforced Language Models for Sequential Decision Making RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7aa594cb-4c8a-478f-ae57-3b1519b1ff55 · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 3486c8ef-1a95-45c4-9c0e-dbe2f1a955d4 · outbound
Reinforced Language Models for Sequential Decision Making ReAct: Synergizing Reasoning and Acting in Language Models
Reference 36
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c039a950-0021-4e08-ad64-583bfbda2dcc · outbound
Reinforced Language Models for Sequential Decision Making DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 480a7a2d-b987-4bcd-b671-16d83a504fa6 · outbound
Reinforced Language Models for Sequential Decision Making Building Cooperative Embodied Agents Modularly with Large Language Models
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f19ef7d3-1b2c-4a0d-9504-ef08ea9118b9 · outbound
Reinforced Language Models for Sequential Decision Making Group Sequence Policy Optimization
Reference 39
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5bed92c2-63fe-4f30-be1e-1285c0b08239 · outbound
Reinforced Language Models for Sequential Decision Making DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments
Reference 40
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 50ee1f6f-2450-4e74-b775-ef523dadca71 · outbound
Reinforced Language Models for Sequential Decision Making DPO Meets PPO: Reinforced Token Optimization for RLHF
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 34b45a5f-aca1-4bfe-a42f-8cc1569ff09b · outbound
Reinforced Language Models for Sequential Decision Making Unresolved cited work
Reference 42
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 30982ed7-f0ed-41fd-8af0-906022070f59 · outbound
Reinforced Language Models for Sequential Decision Making Fine-Tuning Language Models from Human Preferences
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 759d0bba-280a-4393-9ad9-cc3baaeb6ec2 · inbound
Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse Reinforced Language Models for Sequential Decision Making
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.
Observation 8bf19e1c-060b-42d3-80d1-189e0a0ccc6c · inbound
Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse Reinforced Language Models for Sequential Decision Making
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.