Pith. sign in

Paper Citation Record · LEDGER

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions

As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2508.21188.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.21188 v2

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T14:35:52.198507Z

measured 26 of 26 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T10:13:15.414661Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-30T21:05:04.650707Z

Reference resolution

24 of 24 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved22
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d91e600d-092a-47f8-aa07-3c2213d50cbb · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.599957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.599957Z digest=sha256:5ec6ffa77bd8297a5a6c5edf705964a95dafbebb989f42714a873d68afdf6bae

Observation 4a52c702-ba68-4ee9-9539-dc89e4ac3154 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.713715Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.713715Z digest=sha256:6ecba38e4780534a53a428e4925819ddcda167e140233ccfcc6afa1dfa628a30

Observation 920baffd-8102-4ed6-a9a0-9c5665ef8fb3 · outbound

This paper cites BIG-Bench Extra Hard.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions BIG-Bench Extra Hard

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.806216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.806216Z digest=sha256:7451d3bd40f212243411ffce598863a710325c97fb83f4e56a52c7415f0a66a6

Observation e75d04a6-b8f8-4f1a-b647-0042b164180d · outbound

This paper cites SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.883516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.883516Z digest=sha256:a545d6781786f1b7c4517a6f53a036da489ef9c16ee2e2db967a1585c506192d

Observation 44a3cdc7-cb6d-4f98-8329-29478b16b20e · outbound

This paper cites The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.973056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.973056Z digest=sha256:1b5de5e91d8d7df46a4865d4d5b79893679f97dac3146f9f7c66739669c04cd4

Observation ba9d74c3-dfff-40d4-a8b7-f1245ac45eb0 · outbound

This paper cites KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.058824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.058824Z digest=sha256:0384defb7b6d862fc553c5ec2b87cd1ace6356e1385f40fec3b0e9aca1040941

Observation b6f85f85-7ff3-4df7-ac01-01f864a1883f · outbound

This paper cites The Llama 3 Herd of Models.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The Llama 3 Herd of Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.138696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.138696Z digest=sha256:422d8a39615e0f59d7da9fef8ac511c5442e40b2f803587079d752c4d3571226

Observation 360502bb-0bf8-443c-8b4b-c54c739bc552 · outbound

This paper cites Qwen2.5 Technical Report.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen2.5 Technical Report

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.218027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.218027Z digest=sha256:3a7a981ce5315b3be8e2e9d82b18bde42cff4d1a4fd601e798ac11e6ccb5efb2

Observation 44f72023-4147-499e-a3ee-f9bc4bef15eb · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.290902Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.290902Z digest=sha256:40faded5f0531730db15ebaf337b45da7c03562e3a394de67895e496d2f931cf

Observation cde19674-1179-4713-ad61-86d99b27d526 · outbound

This paper cites Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.350639Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.350639Z digest=sha256:7129b2f59b4f29d834bb7bc964035848c61666ba57a372e4a5a7dd698b6b9f96

Observation 8ee51b7f-ac07-47e9-89b6-74018e1af83f · outbound

This paper cites Reinforcement Learning for Reasoning in Large Language Models with One Training Example.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.606028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.606028Z digest=sha256:a7f0842c4727831e17bdc3237e8ef93464eef015891dd289b099a83d892568bc

Observation dd79800b-fecd-405a-a6fd-aafd6af5ed3f · outbound

This paper cites Reasoning or memorization? unreliable results of reinforcement learning due to data contamination.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Reasoning or memorization? unreliable results of reinforcement learning due to data contamination

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.701515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.701515Z digest=sha256:ed3dfba6379061d463c0af68dc3efe4feb309508fba184aa128d61cdea4eae26

Observation 6928d6d9-b19f-44b0-8891-3e26d347ef82 · outbound

This paper cites Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.798748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.798748Z digest=sha256:075706ee26a1367308141bad3f97da287cdb5ed1b17e59d5cf972c783c7cce14

Observation 77b662ac-1ccc-4f5c-8e8b-06c47cd8619c · outbound

This paper cites Qwen3 Technical Report.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Qwen3 Technical Report

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.888457Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.888457Z digest=sha256:70221b7e4957989e0e10fecf648cd70a8e19b38878f0d8e99720894d4142c90e

Observation f521cb35-0606-48b9-995f-748399cf3d8b · outbound

This paper cites Daniel M Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B Brown, Alec Radford, Dario Amodei, Paul Christiano, and Geoffrey Irving.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Daniel M Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B Brown, Alec Radford, Dario Amodei, Paul Christiano, and Geoffrey Irving

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.980645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.980645Z digest=sha256:fa273b2f55d42c6da02c183be015950c9cf8582879a85221f9821469e34a7957

Observation 65520dd4-4391-4260-b429-56cd12c0c684 · outbound

This paper cites The format reward is different from that of Shao et al.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions The format reward is different from that of Shao et al

Reference 23

Resolution
malformed identifier
raw_fallback, observed 2026-08-05T14:35:53.101114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T14:35:52.102509Z digest=sha256:199214e3801051740cf5535a12ce73376b8b3266b203f8e6a41b02f43e0f74ee

Observation 3b774ea2-a172-4f3a-91cc-561c70806613 · outbound

This paper cites an unresolved cited work.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-05T14:35:52.956984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T14:35:52.198507Z digest=sha256:b077554f13adab41c90983b3c69e380e9a1d96720a2927b8b8cc2629b7a561c1

Observation f0ac64dc-1cd8-42bb-a316-3a8140bbfc4c · outbound

This paper cites Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them

Reference 1998

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.402781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.402781Z digest=sha256:d12eecca9de382fa005df87cb00b95d8d027c05149f809035ae99187c1025df1

Observation 505fbb72-68cb-49d4-bd23-1aa857ad6973 · outbound

This paper cites TTRL: Test-Time Reinforcement Learning.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions TTRL: Test-Time Reinforcement Learning

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:52.017655Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:52.017655Z digest=sha256:cd125e24d7d5181684e70df4697a7966316e51d580b05f5f283ee4b294b4389e

Observation b25332ec-6417-42d4-a68f-75cfce780dbf · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.660785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.660785Z digest=sha256:1b68bfc044fb299b2d3dbe2dfa40d8835c22e744f46147be7516720f26194ca5

Observation 7925ea58-f691-467b-9db3-a47591b3db85 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:51.511047Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:51.511047Z digest=sha256:7f2420ad8146bd6de2ff38e2019c3bbd5f3b01a5e59179d50b2205d2e62a64ea

Observation 92c72353-49a2-4e9c-9e84-ad284e08276f · outbound

This paper cites Jiangjie Chen, Qianyu He, Siyu Yuan, Aili Chen, Zhicheng Cai, Weinan Dai, Hongli Yu, Qiying Yu, Xuefeng Li, Jiaze Chen, Hao Zhou, and Mingxuan Wang.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Jiangjie Chen, Qianyu He, Siyu Yuan, Aili Chen, Zhicheng Cai, Weinan Dai, Hongli Yu, Qiying Yu, Xuefeng Li, Jiaze Chen, Hao Zhou, and Mingxuan Wang

Reference 2023

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T14:35:53.294734Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T14:35:50.447943Z digest=sha256:b7b31247c37066ecfb2840adb94a3d8b53df720bf0d8269a8517005edbc1b01e

Observation c47a4f8d-25df-4038-a11b-b53762be1fb8 · outbound

This paper cites an unresolved cited work.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Unresolved cited work

Reference 2024

Resolution
unresolved
raw_fallback, observed 2026-08-05T14:35:53.457163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T14:35:50.378699Z digest=sha256:2151cd508d354dbb2428773c13e9e383bff3252ff767737058204ff9bbcaef0d

Observation a5b5ccbf-b8d3-43df-b2f1-c22b04f2d239 · outbound

This paper cites Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles.

Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-05T14:35:50.493578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T14:35:50.493578Z digest=sha256:6503fad80c42c772d2546effa48186935ffe2bcae0c0a20f2c452b2dd485c8da

Pith citing papers

Observation efa8a444-62f3-40aa-86a1-443620487913 · inbound

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs cites this paper.

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-03T10:13:15.414661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T10:13:15.414661Z digest=sha256:07c30e2ffbcd72d4a82f761657aba30585a6624004356016ba5d0f15ac693281

Observation 6bf40004-0e52-4f1a-958a-38305042e275 · inbound

Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis cites this paper.

Learning to Build the Environment: Self-Evolving Reasoning RL via Verifiable Environment Synthesis Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-06-30T21:05:04.652492Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-30T20:58:07.921910Z digest=sha256:067fb23792f9255fd19fe61711dfba52b2183ca39f1a55c15e29445b1507fd75