Pith. sign in

Paper Citation Record · LEDGER

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions

As of 17 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2508.21188.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.21188 v2

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T14:35:52.198507Z

measured 26 of 26 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T10:13:15.414661Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-30T21:05:04.650707Z

Reference resolution

24 of 24 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved22
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d91e600d-092a-47f8-aa07-3c2213d50cbb · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.599957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.599957Z digest=sha256:7810bd8574c4c387de21a9f6f9c7e3aac3c3eb14aead4f5f2aaa50bf28b325ac

Observation 4a52c702-ba68-4ee9-9539-dc89e4ac3154 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.713715Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.713715Z digest=sha256:68375220f1b51614f56d339d0e20bc70632d6dee7fbea775112784a3cc668d1d

Observation 920baffd-8102-4ed6-a9a0-9c5665ef8fb3 · outbound

This paper cites BIG-Bench Extra Hard.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions BIG-Bench Extra Hard

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.806216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.806216Z digest=sha256:b9d8990b367039597431431da3a9e8c47e48bf7d209e1b643386fba13fa014d8

Observation e75d04a6-b8f8-4f1a-b647-0042b164180d · outbound

This paper cites SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.883516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.883516Z digest=sha256:d0a1145e82345673bad4b444a123343038f84d7c63d4aac0e2459b30270e9631

Observation 44a3cdc7-cb6d-4f98-8329-29478b16b20e · outbound

This paper cites The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.973056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.973056Z digest=sha256:2b89c0b8138ed96525866923acb0fa37a8655a53dc7732909c1447a231f0f6cd

Observation ba9d74c3-dfff-40d4-a8b7-f1245ac45eb0 · outbound

This paper cites KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.058824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.058824Z digest=sha256:9b79830bc9d3014dd0646c002569e95dded686080300d77bac7f7bd379d85da1

Observation b6f85f85-7ff3-4df7-ac01-01f864a1883f · outbound

This paper cites The Llama 3 Herd of Models.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The Llama 3 Herd of Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.138696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.138696Z digest=sha256:dd2a6a82fe4a4a323af5ff4fe917328631f1e0d7f2e0424225b4452fcab96c22

Observation 360502bb-0bf8-443c-8b4b-c54c739bc552 · outbound

This paper cites Qwen2.5 Technical Report.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen2.5 Technical Report

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.218027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.218027Z digest=sha256:f49c94f6deca3a2aa7349e13d96e19bbd103d5790e3c3896d93cb8a98b250bca

Observation 44f72023-4147-499e-a3ee-f9bc4bef15eb · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.290902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.290902Z digest=sha256:28c0d15bf6f9248e603843e9543c09cd9bddcd7af1248464b7c4b528728a27ee

Observation cde19674-1179-4713-ad61-86d99b27d526 · outbound

This paper cites Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.350639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.350639Z digest=sha256:fa7df06fd45a65b621a38198f39762a6d859b92d2cf70c28f2a8db2f3e724bb4

Observation 8ee51b7f-ac07-47e9-89b6-74018e1af83f · outbound

This paper cites Reinforcement Learning for Reasoning in Large Language Models with One Training Example.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.606028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.606028Z digest=sha256:b547de557adc67402f0897bb29d12763d1ee07e75191c806722bb2b25c1ab401

Observation dd79800b-fecd-405a-a6fd-aafd6af5ed3f · outbound

This paper cites Reasoning or memorization? unreliable results of reinforcement learning due to data contamination.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Reasoning or memorization? unreliable results of reinforcement learning due to data contamination

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.701515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.701515Z digest=sha256:65596837287a3149e65732e626801ffad0a44b6543c512a4e989133fc0b1fda3

Observation 6928d6d9-b19f-44b0-8891-3e26d347ef82 · outbound

This paper cites Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.798748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.798748Z digest=sha256:4ada50f50120293e6d1e1a3ec1419a527d9737da2e60e5187d0b227b3e8804e4

Observation 77b662ac-1ccc-4f5c-8e8b-06c47cd8619c · outbound

This paper cites Qwen3 Technical Report.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen3 Technical Report

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.888457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.888457Z digest=sha256:7b3a5ed76ac1ded9c67d8a4806350921fe2c5105c87e61ff89e5c9917c92369e

Observation f521cb35-0606-48b9-995f-748399cf3d8b · outbound

This paper cites Daniel M Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B Brown, Alec Radford, Dario Amodei, Paul Christiano, and Geoffrey Irving.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Daniel M Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B Brown, Alec Radford, Dario Amodei, Paul Christiano, and Geoffrey Irving

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.980645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.980645Z digest=sha256:591f75f4f7efa1aca5722ec8d8b732d550de44836b2aa60701c208ceafeee9ed

Observation 65520dd4-4391-4260-b429-56cd12c0c684 · outbound

This paper cites The format reward is different from that of Shao et al.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The format reward is different from that of Shao et al

Reference 23

Resolution
malformed identifier
raw_fallback, observed 2026-08-05T14:35:53.101114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T14:35:52.102509Z digest=sha256:b0477292a48190dcd527ac9010eced55aa97489e7e8189d5199a54deaa12f08a

Observation 3b774ea2-a172-4f3a-91cc-561c70806613 · outbound

This paper cites an unresolved cited work.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-05T14:35:52.956984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T14:35:52.198507Z digest=sha256:c288cd10e99e44695bcc4e203c8ed0d5425c2f797a6fe56f0957ea720c9f6d0e

Observation f0ac64dc-1cd8-42bb-a316-3a8140bbfc4c · outbound

This paper cites Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them

Reference 1998

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.402781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.402781Z digest=sha256:d7544905a973d5dbc731b1e7c7f6926d6aeb4cce790da6b326a219fde9b174fd

Observation 505fbb72-68cb-49d4-bd23-1aa857ad6973 · outbound

This paper cites TTRL: Test-Time Reinforcement Learning.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions TTRL: Test-Time Reinforcement Learning

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:52.017655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:52.017655Z digest=sha256:98c423d38484308913ca4aac1de19a26a6464b7633f12c1f5861d3a6e3325a53

Observation b25332ec-6417-42d4-a68f-75cfce780dbf · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.660785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.660785Z digest=sha256:69f76b86773089ac82da8da5e497cf7a80b1f6759ac754fa137815b2df3a63b6

Observation 7925ea58-f691-467b-9db3-a47591b3db85 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.511047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.511047Z digest=sha256:00830a617b0ebaf2943f030b48bd1f07d4702d55fbf29c7d774aebb62080726c

Observation 92c72353-49a2-4e9c-9e84-ad284e08276f · outbound

This paper cites Jiangjie Chen, Qianyu He, Siyu Yuan, Aili Chen, Zhicheng Cai, Weinan Dai, Hongli Yu, Qiying Yu, Xuefeng Li, Jiaze Chen, Hao Zhou, and Mingxuan Wang.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Jiangjie Chen, Qianyu He, Siyu Yuan, Aili Chen, Zhicheng Cai, Weinan Dai, Hongli Yu, Qiying Yu, Xuefeng Li, Jiaze Chen, Hao Zhou, and Mingxuan Wang

Reference 2023

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:35:53.294734Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T14:35:50.447943Z digest=sha256:723200c714ee62ef57a09595cde7c8d37828b976d7f14b28647db6e5d5e9b1ff

Observation c47a4f8d-25df-4038-a11b-b53762be1fb8 · outbound

This paper cites an unresolved cited work.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Unresolved cited work

Reference 2024

Resolution
unresolved
raw_fallback, observed 2026-08-05T14:35:53.457163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T14:35:50.378699Z digest=sha256:b5edc4a509b4555da038dc80262cf63e7d55e8f607e955f473cbf781a92c985d

Observation a5b5ccbf-b8d3-43df-b2f1-c22b04f2d239 · outbound

This paper cites Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.493578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.493578Z digest=sha256:624021809f7b5ad905b222b04a8dc5270468d345e9cff0c1092309bce51e495e

Pith citing papers

Observation efa8a444-62f3-40aa-86a1-443620487913 · inbound

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs cites this paper.

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T10:13:15.414661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T10:13:15.414661Z digest=sha256:d9c95ebfc6a2e91553266e88de91ef4cff3d2dbf82a2352f37a6bd6407f31e66

Observation 6bf40004-0e52-4f1a-958a-38305042e275 · inbound

Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis cites this paper.

Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-06-30T21:05:04.652492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-30T20:58:07.921910Z digest=sha256:948c95ad5749d0f2cff8e432b9047e71e0323da36b6dffd84d5d0454a7d4e82e