Pith. sign in

Paper Citation Record · LEDGER

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

As of 15 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 11 inbound Pith citation observations for arXiv:2509.09675.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.09675 v1

Coverage vector

measured 34 of 34 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T18:53:02.820543Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T10:36:23.165454Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T16:39:57.677897Z

Reference resolution

34 of 34 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved34
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7c8d4574-d36e-4a66-9513-d4dc796d50d7 · outbound

This paper cites A Survey of Exploration Methods in Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models A Survey of Exploration Methods in Reinforcement Learning

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.597599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.597599Z digest=sha256:12170c2c53a24e3533681cc8b467e0cb4dcfb55668b90367a8910f51a31089af

Observation 7086f6d9-3732-48fc-84fc-8e693773f390 · outbound

This paper cites std ´␣ ϕJpwpkq n,h ˇˇ1ďkďK (¯ . Elliptical (“count-based.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models std ´␣ ϕJpwpkq n,h ˇˇ1ďkďK (¯ . Elliptical (“count-based

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.820543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.820543Z digest=sha256:0dd0a6e8fb1a0fca97a7ffad8ae6d6050311b6150a47187c67bb1a24a6096a37

Observation 5aa8ec28-2077-4742-851a-d95c0b788c38 · outbound

This paper cites Qwen3-4B-Base-GRPO.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Qwen3-4B-Base-GRPO

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.813713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.813713Z digest=sha256:86683f8f970ac3a30277e03a3aa4c674b9568a1e517fecbd3e118925e0ccc735

Observation e18ab364-7475-43b4-9f0e-aa8b67c2eb79 · outbound

This paper cites The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.638102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.638102Z digest=sha256:7d02914649975edacba128ad5e7d8b501345c7b9ba5c6a0a9983617905278d50

Observation 6747d781-40bb-453b-a586-a9ba2a630f5f · outbound

This paper cites Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.644861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.644861Z digest=sha256:fe3465d305caafd7b9301a11b1c75003d036d09f0b9abbc19048f833c15d2ac1

Observation b7a85f9e-f9a8-4575-8593-467edb25e281 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.672697Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.672697Z digest=sha256:6f224206d21a608f605e084e354e017f0f332f2a5d3360ab5db27dd7beb580f5

Observation edf8c7ba-09fc-4dea-9987-691406fe9548 · outbound

This paper cites R-Zero: Self-Evolving Reasoning LLM from Zero Data.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models R-Zero: Self-Evolving Reasoning LLM from Zero Data

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.690293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.690293Z digest=sha256:a0d0ecf6d751aec6c2beefd4148685355d7f44ec6270fd95f09176d63e5237c5

Observation 82224b45-c9a0-41ba-b27b-66d47ad1791c · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.696442Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.696442Z digest=sha256:4d0e0dd19a97a66600c9e778f3da3386b2c5282e25dc903bc3661fb795dca975

Observation a6d24b4f-2202-4ed8-8b6c-22d35406aa26 · outbound

This paper cites Continuous control with deep reinforcement learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Continuous control with deep reinforcement learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.713848Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.713848Z digest=sha256:2c2c190ba578d71fec4fbabeb2750e39e580d87ffd3b5a48efe50ea93ac478a0

Observation 90686f68-f452-49b0-a015-954971bc96dc · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.719173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.719173Z digest=sha256:e3f086167b4c6464f1a58249940a1e1c5f767257c03af7cbf49e60107e0eb9f9

Observation c3fe07f1-8719-4bc0-9cad-4ef046aac618 · outbound

This paper cites Proximal Policy Optimization Algorithms.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Proximal Policy Optimization Algorithms

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.725388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.725388Z digest=sha256:1ec680f7139a160a7beea39fd6725daece78a7123915f95f7331cae31f2d091e

Observation 0d2781dd-027f-4a65-a4c0-b329ef2326e0 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.730852Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.730852Z digest=sha256:2f8451ceee4a2f775cb5448d96d63574061724e81e0f7d42f3266f1db45c5490

Observation 85d9f907-6cf2-486c-9306-6d340ed9c89a · outbound

This paper cites On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493,.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.736661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.736661Z digest=sha256:d77bba2ffe0ef20f41f1ecc859340e5e3634b709dc47a52961ccb7245a07e568

Observation 5f4aa9d9-897b-4962-9273-2271b2e68222 · outbound

This paper cites Thermometer: Towards Universal Calibration for Large Language Models.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Thermometer: Towards Universal Calibration for Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.742636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.742636Z digest=sha256:7ba8a4de8446387e66d3e6535618691bb58e2dd1b509b9288155a10cc450d329

Observation 555c6c82-7c77-4038-a2f9-43400cb59813 · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Solving math word problems with process- and outcome-based feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.748248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.748248Z digest=sha256:c5851c1cb4184f2d4ce7bc8eb6464ebec8d43cdd16b50c292d50d1f5bc811bfc

Observation f22aacd1-a65f-4627-9d38-08d962735cec · outbound

This paper cites LiteSearch: Efficacious Tree Search for LLM.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models LiteSearch: Efficacious Tree Search for LLM

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.763705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.763705Z digest=sha256:f8d6e953e75c2b512d1e8b96a0e1fd107937f458a9ad445a8a5ef70266c6736e

Observation beefff04-48de-4cf9-b381-03c75111e970 · outbound

This paper cites Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.770333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.770333Z digest=sha256:292145be20b757f986c5ee64f25aef68be30a7b6983310202eaf9540ed1a2684

Observation c00dd1be-6d63-497a-aaf2-83d01e19e1ec · outbound

This paper cites Qwen3 Technical Report.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Qwen3 Technical Report

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.782542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.782542Z digest=sha256:a003d44522ff50d9e22ab6dde09b43c5aa75d10d23df43c20cf4e5771f6393f8

Observation 14604fba-6511-4875-b9b9-6e734e0d09cb · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.789262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.789262Z digest=sha256:37c9792b686bc66a5df7cd96903cb64d3aa68150d71931170b0d1ed0746ed009

Observation 785be2f1-8e1f-4b8f-86da-ff8b432162eb · outbound

This paper cites VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.795969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.795969Z digest=sha256:86b63ecfaa2bdda07bbcbb67b173aad83230d2cbfd380df4f45b5f5e267e0cd4

Observation 0f693e32-c32b-4e35-8cc7-c3c537d19128 · outbound

This paper cites One Token to Fool LLM-as-a-Judge.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models One Token to Fool LLM-as-a-Judge

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.802208Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.802208Z digest=sha256:23bf85ddd2c4cf4ffc70ac22b4d2320e5b8d540dac7e436a8adbc05a701f33c7

Observation 832c0674-f33c-4253-8d81-84f819a15d64 · outbound

This paper cites Learning to Reason via Mixture-of-Thought for Logical Reasoning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Learning to Reason via Mixture-of-Thought for Logical Reasoning

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.808040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.808040Z digest=sha256:f808f25d9b597b9a3f5d528c1a10cf6a018719e3090763546c2875fa35e4b07b

Observation 398b7170-af66-43e5-b8c6-f39c12d228aa · outbound

This paper cites Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training

Reference 1997

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.654971Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.654971Z digest=sha256:ca1e58b9435271ec7262afeae9d47eb707d60ee8215c37b148e01c678440a0d0

Observation b36915be-0427-4923-9bf1-971eaa09ee47 · outbound

This paper cites Self-Rewarding Vision-Language Model via Reasoning Decomposition.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Self-Rewarding Vision-Language Model via Reasoning Decomposition

Reference 2010

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.707977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.707977Z digest=sha256:e83bd5fd3c870167ebb02836915c67566490b93e52119c75e5c68168ee2a884b

Observation d9bacd8f-e76d-40d2-82f6-9ca30d510465 · outbound

This paper cites Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.666926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.666926Z digest=sha256:84c8b5c6468ddce40ffb2bb76c70c1c0eae818b8a4d47446662f360d96d88a7e

Observation 1c617351-2487-4a29-9d57-4246570be9c3 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.702231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.702231Z digest=sha256:ac615b414af5149630649e1c2644317c863fd2991dc86cfc29c367ecdee0f717

Observation 12a00344-c489-4e71-83da-94b86ecbb9da · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.684631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.684631Z digest=sha256:d2fe377b9a6914678d0562f7400d8e0ac9b6c958cd814512382132051ec68fa6

Observation 5d9c5d8f-b005-415a-a257-49ea048cacfc · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Training Verifiers to Solve Math Word Problems

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.630026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.630026Z digest=sha256:2656d1bcf04e2fdf920c402bc5dbe62d9a64da58f8994d31e286833e784688a0

Observation 2fe00bae-31bc-4acd-938e-f62307b1658f · outbound

This paper cites Supervising the search process produces reliable and generalizable information-seeking agents.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Supervising the search process produces reliable and generalizable information-seeking agents

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.776951Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.776951Z digest=sha256:f21c35fc0c7d34699b9220300fc29a4573899b666853337a2593d1308ce0c5aa

Observation f0ebcc62-be89-4ba5-b101-e6d25f04a06e · outbound

This paper cites Online Preference Alignment for Language Models via Count-based Exploration.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Online Preference Alignment for Language Models via Count-based Exploration

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.606163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.606163Z digest=sha256:e4198fc7a135356454baaa70fb53a86782f8b20f63ac44e363818a6252917e24

Observation 3cdec345-3fa4-4bd6-ba62-80192386feb1 · outbound

This paper cites Calibrating Large Language Models Using Their Generations Only.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Calibrating Large Language Models Using Their Generations Only

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.754686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.754686Z digest=sha256:ec045fe70c60b4bea1cc40fccce3ce7389b612663e947acd048005d839671e31

Observation c8f1606b-f184-41d0-b092-a942c03e5d23 · outbound

This paper cites Deep Think with Confidence.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Deep Think with Confidence

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.660976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.660976Z digest=sha256:9b398dbda04bebe30664073dc4bbe4eea3c79f3f65b83b797bb1f21bc36a2bfc

Observation 7fce78d2-28a7-4bd5-b754-c5491bdec338 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.678938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.678938Z digest=sha256:87fa881575820c4b51fec904003ea774d79fb489126ddd03c42c310922b2dddb

Observation 5a58071c-5895-4ae0-ab48-1c5826335408 · outbound

This paper cites Exploration by Random Network Distillation.

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models Exploration by Random Network Distillation

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-04T18:53:02.613187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T18:53:02.613187Z digest=sha256:5f6a4aa23d3d52f4fd0a3f669756da2a41158a2895162c686f3518a5d609ac5f

Pith citing papers

Observation 09f464ea-0ad7-4475-8c3d-19cd3b1ec900 · inbound

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics cites this paper.

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T10:36:23.165454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T10:36:23.165454Z digest=sha256:a58bdd9eafb0f1a5b2fb3d5a5e7e07c4c9b27cc2258fb7486e2f72406767fb19

Observation 93ca5813-c903-41f5-8c9b-4dd664148796 · inbound

Calibration-Aware Policy Optimization for Reasoning LLMs cites this paper.

Calibration-Aware Policy Optimization for Reasoning LLMs CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-11T10:06:01.061297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-05-10T15:40:24.396851Z digest=sha256:59b1bab3bc4fa4019f6ebc19ac8c2114582be3ca823a19e03cbc98de90b67955

Observation c50ad9dd-2bad-4881-a5e8-43369204a2e7 · inbound

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data cites this paper.

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-10T05:36:01.999728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-05-10T05:32:23.972335Z digest=sha256:6a8eb8f916d7430dedaca7dd073009f9985c52e7b075d3dc7ea43a6313907879

Observation 45a82209-4970-43e8-9141-2cf073ebb7ec · inbound

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning cites this paper.

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-12T10:11:28.843337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-07T07:00:32.206081Z digest=sha256:644365d5e07b1ae9c78ea750c1efb923a413fcefbf78547bd7c356279d78ad41

Observation 368f6c5e-2403-4604-9882-89a8c77393e9 · inbound

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning cites this paper.

Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-20T23:49:14.899678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-20T23:47:53.282259Z digest=sha256:7aaf9a84073829636b258eefc6b33388e90a9a66c0013be8a9128474f12b9900

Observation 236cf7f9-3abe-43d0-8427-5a59be816a68 · inbound

Reinforcing Multimodal Reasoning Against Visual Degradation cites this paper.

Reinforcing Multimodal Reasoning Against Visual Degradation CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:06:25.142345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-12T04:37:21.451146Z digest=sha256:0d2e32bc4c08726c09dca2e75fdbd960c87efe12d2daae134a2a86bac0927f4e

Observation 9d32ec0f-a3ba-43e5-bbd1-5de9823bc9c3 · inbound

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification cites this paper.

DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:01:24.281809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-12T04:41:44.833354Z digest=sha256:a18f54880471882c4197d5a238c7ce218de11b8f3a8e435c879f96d1bd6b0a1d

Observation 3039b200-07d3-4b2c-a9be-e5fcab8a40e4 · inbound

Epistemic Uncertainty for Test-Time Discovery cites this paper.

Epistemic Uncertainty for Test-Time Discovery CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-13T01:57:06.101531Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-13T01:52:41.192353Z digest=sha256:4168431961557417f81543a9301b48240f2f2676f5fa21de48c04e78dc8eac32

Observation 1358ee36-5a8f-4a5b-a9b9-66951295ece0 · inbound

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter cites this paper.

SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-02T11:46:56.173296Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-28T02:53:22.159132Z digest=sha256:010efa08dd80c92c5ecd01461adad04e3430b0676900c37e9eb77d7b9c9bb650

Observation 92d15d31-edab-49ac-955e-6afb9bba302f · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-07-04T07:59:40.656115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:d4f04a446da93215a9ace7d23be1543df25a571fb02f98fa8afc792585582e4a

Observation 59aabf2b-ef39-4e89-967b-6d107da89b62 · inbound

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning cites this paper.

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-04T16:39:57.679442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-06-26T00:23:16.499175Z digest=sha256:e16b3e4ca0720f5b3b2c0f238e9bafd26e57cd5238687419b92c00bf9f3b7be7