Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-05T14:35:52.198507Z
Paper Citation Record · LEDGER
As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2508.21188.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-05T14:35:52.198507Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-03T10:13:15.414661Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-06-30T21:05:04.650707Z
24 of 24 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation d91e600d-092a-47f8-aa07-3c2213d50cbb · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4a52c702-ba68-4ee9-9539-dc89e4ac3154 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 920baffd-8102-4ed6-a9a0-9c5665ef8fb3 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions BIG-Bench Extra Hard
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e75d04a6-b8f8-4f1a-b647-0042b164180d · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 44a3cdc7-cb6d-4f98-8329-29478b16b20e · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ba9d74c3-dfff-40d4-a8b7-f1245ac45eb0 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b6f85f85-7ff3-4df7-ac01-01f864a1883f · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The Llama 3 Herd of Models
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 360502bb-0bf8-443c-8b4b-c54c739bc552 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen2.5 Technical Report
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 44f72023-4147-499e-a3ee-f9bc4bef15eb · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Direct Preference Optimization: Your Language Model is Secretly a Reward Model
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cde19674-1179-4713-ad61-86d99b27d526 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8ee51b7f-ac07-47e9-89b6-74018e1af83f · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Reinforcement Learning for Reasoning in Large Language Models with One Training Example
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dd79800b-fecd-405a-a6fd-aafd6af5ed3f · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Reasoning or memorization? unreliable results of reinforcement learning due to data contamination
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6928d6d9-b19f-44b0-8891-3e26d347ef82 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 77b662ac-1ccc-4f5c-8e8b-06c47cd8619c · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen3 Technical Report
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f521cb35-0606-48b9-995f-748399cf3d8b · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Daniel M Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B Brown, Alec Radford, Dario Amodei, Paul Christiano, and Geoffrey Irving
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 65520dd4-4391-4260-b429-56cd12c0c684 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The format reward is different from that of Shao et al
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 3b774ea2-a172-4f3a-91cc-561c70806613 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Unresolved cited work
Reference 24
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation f0ac64dc-1cd8-42bb-a316-3a8140bbfc4c · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them
Reference 1998
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 505fbb72-68cb-49d4-bd23-1aa857ad6973 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions TTRL: Test-Time Reinforcement Learning
Reference 2019
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b25332ec-6417-42d4-a68f-75cfce780dbf · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Measuring Mathematical Problem Solving With the MATH Dataset
Reference 2021
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7925ea58-f691-467b-9db3-a47591b3db85 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Kimi k1.5: Scaling Reinforcement Learning with LLMs
Reference 2022
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 92c72353-49a2-4e9c-9e84-ad284e08276f · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Jiangjie Chen, Qianyu He, Siyu Yuan, Aili Chen, Zhicheng Cai, Weinan Dai, Hongli Yu, Qiying Yu, Xuefeng Li, Jiaze Chen, Hao Zhou, and Mingxuan Wang
Reference 2023
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation c47a4f8d-25df-4038-a11b-b53762be1fb8 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Unresolved cited work
Reference 2024
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation a5b5ccbf-b8d3-43df-b2f1-c22b04f2d239 · outbound
Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles
Reference 2025
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation efa8a444-62f3-40aa-86a1-443620487913 · inbound
Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6bf40004-0e52-4f1a-958a-38305042e275 · inbound
Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions
Reference 41
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.