Pith. sign in

Paper Citation Record · LEDGER

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

As of 17 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 11 inbound Pith citation observations for arXiv:2509.09675.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.09675 v1

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T18:53:02.820543Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T10:36:23.165454Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T16:39:57.677897Z

Reference resolution

34 of 34 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved34
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7c8d4574-d36e-4a66-9513-d4dc796d50d7 · outbound

This paper cites A Survey of Exploration Methods in Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models A Survey of Exploration Methods in Reinforcement Learning

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.597599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.597599Z digest=sha256:3453b774e2f9b8ef2b215acd78478ad5bf0257e91a7ae97caf289114a0991176

Observation 7086f6d9-3732-48fc-84fc-8e693773f390 · outbound

This paper cites std ´␣ ϕJpwpkq n,h ˇˇ1ďkďK (¯ . Elliptical (“count-based.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models std ´␣ ϕJpwpkq n,h ˇˇ1ďkďK (¯ . Elliptical (“count-based

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.820543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.820543Z digest=sha256:0dd0a6e8fb1a0fca97a7ffad8ae6d6050311b6150a47187c67bb1a24a6096a37

Observation 5aa8ec28-2077-4742-851a-d95c0b788c38 · outbound

This paper cites Qwen3-4B-Base-GRPO.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Qwen3-4B-Base-GRPO

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.813713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.813713Z digest=sha256:86683f8f970ac3a30277e03a3aa4c674b9568a1e517fecbd3e118925e0ccc735

Observation e18ab364-7475-43b4-9f0e-aa8b67c2eb79 · outbound

This paper cites The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.638102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.638102Z digest=sha256:7d02914649975edacba128ad5e7d8b501345c7b9ba5c6a0a9983617905278d50

Observation 6747d781-40bb-453b-a586-a9ba2a630f5f · outbound

This paper cites Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.644861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.644861Z digest=sha256:c7d5529ff8af94f9d901fa7ab9eff57011ecb896c9d8504a3ac67f99522d03b8

Observation b7a85f9e-f9a8-4575-8593-467edb25e281 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.672697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.672697Z digest=sha256:6f224206d21a608f605e084e354e017f0f332f2a5d3360ab5db27dd7beb580f5

Observation edf8c7ba-09fc-4dea-9987-691406fe9548 · outbound

This paper cites R-Zero: Self-Evolving Reasoning LLM from Zero Data.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models R-Zero: Self-Evolving Reasoning LLM from Zero Data

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.690293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.690293Z digest=sha256:a0d0ecf6d751aec6c2beefd4148685355d7f44ec6270fd95f09176d63e5237c5

Observation 82224b45-c9a0-41ba-b27b-66d47ad1791c · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.696442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.696442Z digest=sha256:4d0e0dd19a97a66600c9e778f3da3386b2c5282e25dc903bc3661fb795dca975

Observation a6d24b4f-2202-4ed8-8b6c-22d35406aa26 · outbound

This paper cites Continuous control with deep reinforcement learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Continuous control with deep reinforcement learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.713848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.713848Z digest=sha256:a7e103d113b7934c156466b1151ce00e792e35facfa9f9cc9f0ef72d1983cb60

Observation 90686f68-f452-49b0-a015-954971bc96dc · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.719173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.719173Z digest=sha256:e8c7003544b98d9d84244e3560bea5c4df7e02455177b15a7896e39cefb679e7

Observation c3fe07f1-8719-4bc0-9cad-4ef046aac618 · outbound

This paper cites Proximal Policy Optimization Algorithms.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Proximal Policy Optimization Algorithms

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.725388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.725388Z digest=sha256:e0d8100475162e49fee175e2716f487f8867fc97b562497cff4be24425716607

Observation 0d2781dd-027f-4a65-a4c0-b329ef2326e0 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.730852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.730852Z digest=sha256:2f8451ceee4a2f775cb5448d96d63574061724e81e0f7d42f3266f1db45c5490

Observation 85d9f907-6cf2-486c-9306-6d340ed9c89a · outbound

This paper cites On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493,.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.736661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.736661Z digest=sha256:d77bba2ffe0ef20f41f1ecc859340e5e3634b709dc47a52961ccb7245a07e568

Observation 5f4aa9d9-897b-4962-9273-2271b2e68222 · outbound

This paper cites Thermometer: Towards Universal Calibration for Large Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Thermometer: Towards Universal Calibration for Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.742636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.742636Z digest=sha256:6690d94b0d967eaf580695ebfcb33a10380b49f43167eea6d64d51c8ee8f3300

Observation 555c6c82-7c77-4038-a2f9-43400cb59813 · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Solving math word problems with process- and outcome-based feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.748248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.748248Z digest=sha256:c5851c1cb4184f2d4ce7bc8eb6464ebec8d43cdd16b50c292d50d1f5bc811bfc

Observation f22aacd1-a65f-4627-9d38-08d962735cec · outbound

This paper cites LiteSearch: Efficacious Tree Search for LLM.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models LiteSearch: Efficacious Tree Search for LLM

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.763705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.763705Z digest=sha256:af2bbc60209a72f487e7c563f72d92cb138925fca946db831be332212112a4a1

Observation beefff04-48de-4cf9-b381-03c75111e970 · outbound

This paper cites Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.770333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.770333Z digest=sha256:f5a9700684b59a7a1676e1596429b6ec5fe20e37ee221869d303e4b288ae55a9

Observation c00dd1be-6d63-497a-aaf2-83d01e19e1ec · outbound

This paper cites Qwen3 Technical Report.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Qwen3 Technical Report

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.782542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.782542Z digest=sha256:a003d44522ff50d9e22ab6dde09b43c5aa75d10d23df43c20cf4e5771f6393f8

Observation 14604fba-6511-4875-b9b9-6e734e0d09cb · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.789262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.789262Z digest=sha256:37c9792b686bc66a5df7cd96903cb64d3aa68150d71931170b0d1ed0746ed009

Observation 785be2f1-8e1f-4b8f-86da-ff8b432162eb · outbound

This paper cites VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.795969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.795969Z digest=sha256:86b63ecfaa2bdda07bbcbb67b173aad83230d2cbfd380df4f45b5f5e267e0cd4

Observation 0f693e32-c32b-4e35-8cc7-c3c537d19128 · outbound

This paper cites One Token to Fool LLM-as-a-Judge.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models One Token to Fool LLM-as-a-Judge

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.802208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.802208Z digest=sha256:ab22a465bc015ab96b144b3dfee54283ee25474610c971f54328be4138d498e1

Observation 832c0674-f33c-4253-8d81-84f819a15d64 · outbound

This paper cites Learning to Reason via Mixture-of-Thought for Logical Reasoning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Learning to Reason via Mixture-of-Thought for Logical Reasoning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.808040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.808040Z digest=sha256:f808f25d9b597b9a3f5d528c1a10cf6a018719e3090763546c2875fa35e4b07b

Observation 398b7170-af66-43e5-b8c6-f39c12d228aa · outbound

This paper cites Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training

Reference 1997

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.654971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.654971Z digest=sha256:7298194d18518bee3185c0ff342647c37afd10ea21925d9c225592b03836a4db

Observation b36915be-0427-4923-9bf1-971eaa09ee47 · outbound

This paper cites Self-Rewarding Vision-Language Model via Reasoning Decomposition.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Self-Rewarding Vision-Language Model via Reasoning Decomposition

Reference 2010

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.707977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.707977Z digest=sha256:e83bd5fd3c870167ebb02836915c67566490b93e52119c75e5c68168ee2a884b

Observation d9bacd8f-e76d-40d2-82f6-9ca30d510465 · outbound

This paper cites Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.666926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.666926Z digest=sha256:84c8b5c6468ddce40ffb2bb76c70c1c0eae818b8a4d47446662f360d96d88a7e

Observation 1c617351-2487-4a29-9d57-4246570be9c3 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.702231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.702231Z digest=sha256:bbcd644c338b6542cd2683a307fb2c10d66a091560b84b6b7332f7a0e67087e4

Observation 12a00344-c489-4e71-83da-94b86ecbb9da · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.684631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.684631Z digest=sha256:d2fe377b9a6914678d0562f7400d8e0ac9b6c958cd814512382132051ec68fa6

Observation 5d9c5d8f-b005-415a-a257-49ea048cacfc · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Training Verifiers to Solve Math Word Problems

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.630026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.630026Z digest=sha256:2656d1bcf04e2fdf920c402bc5dbe62d9a64da58f8994d31e286833e784688a0

Observation 2fe00bae-31bc-4acd-938e-f62307b1658f · outbound

This paper cites Supervising the search process produces reliable and generalizable information-seeking agents.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Supervising the search process produces reliable and generalizable information-seeking agents

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.776951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.776951Z digest=sha256:61ba214456ba27c036bbd55b6095e0e99b5df43058b4b2ab046771c9471da998

Observation f0ebcc62-be89-4ba5-b101-e6d25f04a06e · outbound

This paper cites Online Preference Alignment for Language Models via Count-based Exploration.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Online Preference Alignment for Language Models via Count-based Exploration

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.606163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.606163Z digest=sha256:e4198fc7a135356454baaa70fb53a86782f8b20f63ac44e363818a6252917e24

Observation 3cdec345-3fa4-4bd6-ba62-80192386feb1 · outbound

This paper cites Calibrating Large Language Models Using Their Generations Only.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Calibrating Large Language Models Using Their Generations Only

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.754686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.754686Z digest=sha256:9419701ed46148c55429690be9e240f36f153266f69e1208262b00583ecf0346

Observation c8f1606b-f184-41d0-b092-a942c03e5d23 · outbound

This paper cites Deep Think with Confidence.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Deep Think with Confidence

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.660976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.660976Z digest=sha256:9b398dbda04bebe30664073dc4bbe4eea3c79f3f65b83b797bb1f21bc36a2bfc

Observation 7fce78d2-28a7-4bd5-b754-c5491bdec338 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.678938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.678938Z digest=sha256:87fa881575820c4b51fec904003ea774d79fb489126ddd03c42c310922b2dddb

Observation 5a58071c-5895-4ae0-ab48-1c5826335408 · outbound

This paper cites Exploration by Random Network Distillation.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Exploration by Random Network Distillation

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.613187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.613187Z digest=sha256:5f6a4aa23d3d52f4fd0a3f669756da2a41158a2895162c686f3518a5d609ac5f

Pith citing papers

Observation 09f464ea-0ad7-4475-8c3d-19cd3b1ec900 · inbound

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics cites this paper.

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T10:36:23.165454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T10:36:23.165454Z digest=sha256:e49fc4943e92814128fa89532198d13ad26ea5b5c7f9dacc03e5bdae0c7f506c

Observation 93ca5813-c903-41f5-8c9b-4dd664148796 · inbound

Calibration-Aware Policy Optimization for Reasoning LLMs cites this paper.

Calibration-Aware Policy Optimization for Reasoning LLMs CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:06:01.061297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-05-10T15:40:24.396851Z digest=sha256:99400fa4fcc1cabbc45928a38ce026c237f8471423996c503cd8962cc0509e65

Observation c50ad9dd-2bad-4881-a5e8-43369204a2e7 · inbound

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data cites this paper.

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-10T05:36:01.999728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-05-10T05:32:23.972335Z digest=sha256:50605b996fbd5e23a75a5e440f9a8a0825629e2910380ba2e80e2a1e8be38b57

Observation 45a82209-4970-43e8-9141-2cf073ebb7ec · inbound

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning cites this paper.

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-12T10:11:28.843337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-07T07:00:32.206081Z digest=sha256:153eda877a1150efd88cdfeac5c7d447834dec9c4cec9d04b6cf35534c409d3f

Observation 368f6c5e-2403-4604-9882-89a8c77393e9 · inbound

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning cites this paper.

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-20T23:49:14.899678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-20T23:47:53.282259Z digest=sha256:e595a47c924fc63710e0d62a8b21640d0abed0bed7ebeed3198a36c9d847a840

Observation 236cf7f9-3abe-43d0-8427-5a59be816a68 · inbound

Reinforcing Multimodal Reasoning Against Visual Degradation cites this paper.

Reinforcing Multimodal Reasoning Against Visual Degradation CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:06:25.142345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-12T04:37:21.451146Z digest=sha256:928897e70a967822c151610e64855d9383bcc7bd63ddf45f246c53f59bdba903

Observation 9d32ec0f-a3ba-43e5-bbd1-5de9823bc9c3 · inbound

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification cites this paper.

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:01:24.281809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-12T04:41:44.833354Z digest=sha256:2b599f9e24ca89746de789bc814ee4fd558434cbf1599496c71f8ba1f8fcda11

Observation 3039b200-07d3-4b2c-a9be-e5fcab8a40e4 · inbound

Epistemic Uncertainty for Test-Time Discovery cites this paper.

Epistemic Uncertainty for Test-Time Discovery CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:57:06.101531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-13T01:52:41.192353Z digest=sha256:627596c07391fa6d89304d40ac5b4158f98ae69979fb1ce2317b1e2ad1539b8f

Observation 1358ee36-5a8f-4a5b-a9b9-66951295ece0 · inbound

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter cites this paper.

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-02T11:46:56.173296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-28T02:53:22.159132Z digest=sha256:4049ac8db986478043967c078c7ee3f8f670277b350cf66dc723d931dd7f054c

Observation 92d15d31-edab-49ac-955e-6afb9bba302f · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-07-04T07:59:40.656115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:2109fe4b6f7c42d03621fab08102df03b13a17bcadfad2556ae178b3d1a5b42b

Observation 59aabf2b-ef39-4e89-967b-6d107da89b62 · inbound

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning cites this paper.

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-04T16:39:57.679442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-06-26T00:23:16.499175Z digest=sha256:841ddf84aa509e421d3d4a449c3173fa1e423ec3427a0a3088c940498a070181