Pith. sign in

Paper Citation Record · LEDGER

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

As of 14 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 8 inbound Pith citation observations for arXiv:2506.01096.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.01096 v2

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T11:55:03.887091Z

measured 42 of 42 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T16:07:35.392271Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T10:09:44.995719Z

Reference resolution

34 of 34 outbound references displayed

  • verified exact0
  • verified fuzzy10
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation befbb2e6-afc4-4ca6-b717-624346b3f37c · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Chain-of-thought prompting elicits reasoning in large language models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.083828Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.083828Z digest=sha256:66779b3377bb59d4e1501464d6a152147421808f5f645aa2cdbcf3b68486a395

Observation b64567fd-2c6f-4e78-b336-93790fcfb5c4 · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.113151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.113151Z digest=sha256:fda307b8cdc2721166a331839ebb0ccb0afc53e514f0d4f54df5f69105f6a719

Observation 22df4bdb-0ecf-42fe-9f2a-95eebf2250fd · outbound

This paper cites Language models are few-shot learners.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Language models are few-shot learners

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.137006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.137006Z digest=sha256:89cc59427c7fb78910f117e5e394b5333890751caa7ffddb9a9f4e8f5192d914

Observation e489ebc3-cc2f-4070-8a70-64637c89b932 · outbound

This paper cites Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.162009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.162009Z digest=sha256:42127bbf077c67ccc9bcdd595f691ddd5a65ee587372d248dddc8d709612d86a

Observation bcd4c7a1-78ae-496b-8327-50f9e70e0ea2 · outbound

This paper cites Automatic Chain of Thought Prompting in Large Language Models.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Automatic Chain of Thought Prompting in Large Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.190168Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.190168Z digest=sha256:4522208dde26aacf76caeaafa2f7ff4021e8b902cc68201c6fa2ed50961de697

Observation 28964c46-5547-4cfb-9622-825fff163593 · outbound

This paper cites GraphReason: Enhancing Reasoning Capabilities of Large Language Models through A Graph-Based Verification Approach.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning GraphReason: Enhancing Reasoning Capabilities of Large Language Models through A Graph-Based Verification Approach

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.225522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.225522Z digest=sha256:449611d8da2f09d8814857d5de7bb843628c3a12b1870006f8051043e1d3994d

Observation 94df85cb-db32-452c-8c20-7f5a5de93bd6 · outbound

This paper cites A survey on test-time scaling in large language models: What, how, where, and how well?, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning A survey on test-time scaling in large language models: What, how, where, and how well?, 2025

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.258257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.258257Z digest=sha256:01515a82312d9aca5b875d74d058db1a5add7b0dcc34b93d08587d5893abe17d

Observation 9338ddea-c370-4b9f-9e52-7648c2347d4a · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.285532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.285532Z digest=sha256:f222ac54083bdf3b12c9f0c97a7f64c08773cae863d89aadb0bf0d3859c0f9ba

Observation 21414b3c-ceb8-4ef5-bd79-08a078c9f758 · outbound

This paper cites an unresolved cited work.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.314686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.314686Z digest=sha256:0c73000b259d73987646ef4ac8a701a4f33da7193fa459f578aff1f17e29fc97

Observation a969b981-7b64-4289-ba12-3d61c909853d · outbound

This paper cites Proximal policy optimization algorithms, 2017.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Proximal policy optimization algorithms, 2017

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.617153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.334322Z digest=sha256:894f14c6f7c7644246133a1b1a7573f737b9c909aef69b0a7e172cdc0198b475

Observation 03d3db60-1000-4849-9aa6-25c1a68c462d · outbound

This paper cites Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Offline reinforcement learning: Tutorial, review, and perspectives on open problems, 2020

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.363724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.363724Z digest=sha256:5e9a3821a6c99e8264225d2ca1f494d4ec9e3dc03e7cd43255e02b6bb757e83a

Observation 307598cd-6566-4d6d-913e-09f248b5ed0a · outbound

This paper cites Off-policy deep reinforcement learning without exploration, 2019.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Off-policy deep reinforcement learning without exploration, 2019

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.392816Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.392816Z digest=sha256:278f7ca6bee75a0ff245190342ce50f77be36df92e2ce8ecad84ab2d5b3cebb8

Observation 8ff2667a-f840-4707-9cb1-31dfb2a487bb · outbound

This paper cites Hindsight experience replay, 2018.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Hindsight experience replay, 2018

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.418313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.418313Z digest=sha256:6c799e7efb8fa3f5a2537331ac62eba816c696bbe638f3b4c73e6db332c65044

Observation abc38dc6-2f94-494e-b86a-b65268e36b42 · outbound

This paper cites Stanley, and Jeff Clune.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Stanley, and Jeff Clune

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.539004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.444735Z digest=sha256:2e7d9bac4564e2935222cca4b5cb16cc16d8bdb92219dc7ed46cf6613c64011f

Observation 5290c543-ebdb-4740-bab8-1459b4cd6b8b · outbound

This paper cites Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.461762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.461762Z digest=sha256:1420b719115f7fbbc23d1ba04adfa93fc9d750d0c9a5f682d6af16c638ba07e3

Observation 66b64877-5f87-45f8-9fc2-d3921434baa7 · outbound

This paper cites an unresolved cited work.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.478502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.478502Z digest=sha256:027157d7a4bc5764dc8e5ad90d4320497ac3d32676d543a612d34dc02efe8f18

Observation b3c40d56-544e-4eb5-9c02-248ecbc58e44 · outbound

This paper cites Le, Sergey Levine, and Yi Ma.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Le, Sergey Levine, and Yi Ma

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.503125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.503125Z digest=sha256:70d0bbcf7b2ace0eff86f41dd8cc77cc12f301e504cf025f697128d53f76a717

Observation a4f97168-a213-4f81-b3c9-2d302dc6a4ad · outbound

This paper cites Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.525409Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.525409Z digest=sha256:b77a1c71e55c3954d9f8b549d73bd2c89b53f1c91143a6810857acbd8d34a964

Observation cf41f148-c6c9-49c2-8ced-fc8de2eb4132 · outbound

This paper cites An empirical study of catastrophic forgetting in large language models during continual fine-tuning, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning An empirical study of catastrophic forgetting in large language models during continual fine-tuning, 2025

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.549531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.549531Z digest=sha256:461582fe882d7925590fda5d8b0a311043416d96d4a333bf2ff69dd723fa77f1

Observation 306ca55a-8977-4c43-b068-e7ae00219c95 · outbound

This paper cites Understanding catastrophic forgetting in language models via implicit inference, 2024.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Understanding catastrophic forgetting in language models via implicit inference, 2024

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.448228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.569493Z digest=sha256:700ec2c94a84989c5e0b3aead0150de3cc9af54192e11733001fe10e0c8bcd5b

Observation 8fa6a720-8bdc-4362-8e8c-d8a6ea5fc475 · outbound

This paper cites Mitigating forgetting in llm supervised fine-tuning and preference learning, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Mitigating forgetting in llm supervised fine-tuning and preference learning, 2025

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.390818Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.597604Z digest=sha256:8410e5c2194e48612f8c846062d2a086df16eb926cdd42a6a891e5352df1cb63

Observation 7760956e-231c-420d-9098-dd4431ee79b7 · outbound

This paper cites A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.329093Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.612392Z digest=sha256:ab76c2e277dae979ba9ac3dbecca575ac8d3702854851afacdf295adedfbee3a

Observation c994f4fb-60e2-4653-a303-8b40efe3183d · outbound

This paper cites Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynam- ics, and success amplification, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Reinforcement learning with verifiable rewards: Grpo’s effective loss, dynam- ics, and success amplification, 2025

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.276059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.639324Z digest=sha256:c3afde5f5a1d4dba7047cd10f42874dd4fce554ed77e82f36ecd73f9433583b1

Observation f531e55b-b3be-4cf7-a260-6a016059b088 · outbound

This paper cites Rlhf workflow: From reward modeling to online rlhf, 2024.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Rlhf workflow: From reward modeling to online rlhf, 2024

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.659964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.659964Z digest=sha256:4d8eb4c82f7b18cc828419d6b7dacfa9a51a069224a7f8bd169bf92223fd0fef

Observation 7fb36c3a-5c5a-4138-b997-813bbe4ba6ef · outbound

This paper cites Crowder, Darrien M.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Crowder, Darrien M

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.220507Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.678865Z digest=sha256:b2c00fe8e4693dc2a0be0ed663fe958da8c032865ea8e6b4525331a85cd85e7f

Observation b572a305-ed7f-472d-8378-deeb0e62d57e · outbound

This paper cites Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.696541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.696541Z digest=sha256:9e359b1c76cb40f5dca5bdb75daa254e9b83a21a80f1fb9414ee5da6cd9e8811

Observation f13cb632-7ea4-4904-b1d0-f366d20484a3 · outbound

This paper cites an unresolved cited work.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.714451Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.714451Z digest=sha256:4cdfad1076ff568845de770e81344d2d9833a5142e5594b9badbb9fe9d1aa1d1

Observation d2ca067d-23e6-4fbe-8ca9-5a00079695ab · outbound

This paper cites Qwen3 technical report, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Qwen3 technical report, 2025

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.160449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.744487Z digest=sha256:4fb6013ab03b59ad4d88d4a000c69dd2024675eccded148e0f60333ec8ca9460

Observation 7c5fd51e-0392-4108-80d5-b889e39e837d · outbound

This paper cites Training verifiers to solve math word problems, 2021.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Training verifiers to solve math word problems, 2021

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.769727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.769727Z digest=sha256:73fcb5766620ae2c98cb05d3d7d3fb89c7ea667cc3648b9a0cf0a2f29b1b9d87

Observation 2d5c1627-49cc-48f1-b045-a3fb593e2a90 · outbound

This paper cites Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Kwok, Zhenguo Li, Adrian Weller, and Weiyang Liu

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.797022Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.797022Z digest=sha256:d92f67d9012a5a4fe8368bc7d6cd01ec4a728725b1f2124f9a3ab722f5a199d3

Observation 434d5553-358d-418f-bc3a-f4b96d842bf7 · outbound

This paper cites Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models, 2023.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models, 2023

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.817483Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.817483Z digest=sha256:9a13a7bf1fcd4756a834a37cc1e916f6b58be38c80051bc4402d4f4ac5b7e373

Observation cffc18b3-eda4-484a-b3b8-37a3de341bae · outbound

This paper cites Limo: Less is more for reasoning, 2025.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Limo: Less is more for reasoning, 2025

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T11:55:03.834330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:55:03.834330Z digest=sha256:2fe8efabaa7e265bbbdf89927e85eedc508ad8d8a0d496cd11805850c9a6165f

Observation a69a6886-5641-4d42-a851-a7db21a2cc25 · outbound

This paper cites Hitab: A hierarchical table dataset for question answering and natural language generation, 2022.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Hitab: A hierarchical table dataset for question answering and natural language generation, 2022

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.073692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.864678Z digest=sha256:de10c59548275a940966fcd92d75d8fe1b5ef2a4297d5a8d6899be5eee254006

Observation d6d5564e-2666-4335-8238-642123a62d77 · outbound

This paper cites Let’s think step by step and output the final answer in boxed{}.

SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning Let’s think step by step and output the final answer in boxed{}

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T11:55:04.023395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-08-07T11:55:03.887091Z digest=sha256:93517456b1132ac0a90fa06e977ff09cfff61d2be2222d283c284b1fe701bc30

Pith citing papers

Observation 90be6e53-f651-415a-b8a1-e2b32ae7e8e1 · inbound

RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization cites this paper.

RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-19T01:16:56.964027Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-19T01:15:49.658412Z digest=sha256:c6f6e766e51c2ea11f5e481d59ccb38d20f6c681aa5aa6080eb9b1a4f8c19a13

Observation 610758d7-d080-41fe-9881-233359ab642e · inbound

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle cites this paper.

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 110

Resolution
unresolved
no resolver link, observed 2026-08-04T16:07:35.392271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:07:35.392271Z digest=sha256:b63625016c129f200976e370346125215006c35fccd8ef4ffc45c7ef2c3e26b7

Observation a2667e53-be8e-46f9-981c-14079b6fe28c · inbound

Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO cites this paper.

Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-03T04:22:10.295612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T04:22:10.295612Z digest=sha256:3135d20ea25f5ea103a09b56cc289a35f9700793b90284ee5251b3c6146770fa

Observation 57240f1c-a150-40d6-ae3d-47b02cb56f43 · inbound

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning cites this paper.

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-11T21:06:14.394139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-08T06:44:34.968571Z digest=sha256:47b8b0fc8996f348606fe628c6ad7de708e65851359361610cce1a12c3475d78

Observation cd5e782a-7809-47d7-a165-0c67046e81f1 · inbound

Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance cites this paper.

Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-05-15T03:19:43.113819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-05-15T03:18:26.590871Z digest=sha256:f37d5a66dc32dc15f43de55080d0b9ac25b89501d90bbd4f8c41ba098f065d83

Observation f2aca1d8-0c27-43b2-9113-1b2e1dc0225e · inbound

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff cites this paper.

When RL Fails after SFT: Rejuvenating Model Plasticity for Robust SFT-to-RL Handoff SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-07-02T22:27:26.464680Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T18:49:47.876179Z digest=sha256:9ce2e5951bf1492380e189516e43bbd09d2de86d910b5977565524b927bd48f5

Observation 92ee178a-556f-4350-8c19-7bb3efef8f13 · inbound

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning cites this paper.

From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 141

Resolution
verified exact
arxiv_id, observed 2026-07-03T20:38:56.058157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T01:13:11.483599Z digest=sha256:82e48d6560f7eb35d8e96ff35d9307f17f49016da80eeaea270e700e9eee028e

Observation 5323e6c5-86e5-44d6-a07b-b521c3fe5daa · inbound

AIR: Adaptive Interleaved Reasoning with Code in MLLMs cites this paper.

AIR: Adaptive Interleaved Reasoning with Code in MLLMs SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T10:09:44.997118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-26T09:06:38.001604Z digest=sha256:4f7428a68a3842e6c295cebd6d5ca8371da0354db07f3ab94862fc2ea4fc4fcb