{"as_of":"2026-08-15T22:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b838fc6dbdc82f2139bd5a8b9540c813c88db3567b2ad57e93f5ed44e46baea","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T18:53:02.820543Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:36:23.165454Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:39:57.677897Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-08-04T10:36:23.165454Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09517","last_updated":"2026-07-02T09:56:45Z","snapshot_observed_at":"2026-08-08T00:15:14.362197Z","submitted_at":"2025-10-10T16:28:43Z","title":"StatEval: A Comprehensive Benchmark for Large Language Models in Statistics","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T10:36:23.165454Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2510.09517"},"observation_digest":"sha256:a58bdd9eafb0f1a5b2fb3d5a5e7e07c4c9b27cc2258fb7486e2f72406767fb19","observation_id":"09f464ea-0ad7-4475-8c3d-19cd3b1ec900","resolution":{"observed_at":"2026-08-04T10:36:23.165454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.12632","last_updated":"2026-04-14T12:03:17Z","snapshot_observed_at":"2026-08-12T20:03:25.354597Z","submitted_at":"2026-04-14T12:03:17Z","title":"Calibration-Aware Policy Optimization for Reasoning LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T15:40:24.396851Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.12632"},"observation_digest":"sha256:59b1bab3bc4fa4019f6ebc19ac8c2114582be3ca823a19e03cbc98de90b67955","observation_id":"93ca5813-c903-41f5-8c9b-4dd664148796","resolution":{"observed_at":"2026-05-11T10:06:01.061297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-08-15T00:45:26.294340Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:6a8eb8f916d7430dedaca7dd073009f9985c52e7b075d3dc7ea43a6313907879","observation_id":"c50ad9dd-2bad-4881-a5e8-43369204a2e7","resolution":{"observed_at":"2026-05-10T05:36:01.999728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-08-15T11:11:20.405441Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T07:00:32.206081Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:644365d5e07b1ae9c78ea750c1efb923a413fcefbf78547bd7c356279d78ad41","observation_id":"45a82209-4970-43e8-9141-2cf073ebb7ec","resolution":{"observed_at":"2026-05-12T10:11:28.843337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-08-15T11:11:20.405441Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T23:47:53.282259Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:7aaf9a84073829636b258eefc6b33388e90a9a66c0013be8a9128474f12b9900","observation_id":"368f6c5e-2403-4604-9882-89a8c77393e9","resolution":{"observed_at":"2026-05-20T23:49:14.899678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2605.09262","last_updated":"2026-05-10T02:17:14Z","snapshot_observed_at":"2026-08-15T21:44:19.533776Z","submitted_at":"2026-05-10T02:17:14Z","title":"Reinforcing Multimodal Reasoning Against Visual Degradation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:37:21.451146Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2605.09262"},"observation_digest":"sha256:0a1b7a0f503b1f97addca9bff276bd68ec04e3b340b3ebe5d5fbda2b96e1a402","observation_id":"236cf7f9-3abe-43d0-8427-5a59be816a68","resolution":{"observed_at":"2026-05-12T06:06:25.142345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2605.09269","last_updated":"2026-05-10T02:32:19Z","snapshot_observed_at":"2026-08-14T13:14:10.140627Z","submitted_at":"2026-05-10T02:32:19Z","title":"DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:44.833354Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2605.09269"},"observation_digest":"sha256:a18f54880471882c4197d5a238c7ce218de11b8f3a8e435c879f96d1bd6b0a1d","observation_id":"9d32ec0f-a3ba-43e5-bbd1-5de9823bc9c3","resolution":{"observed_at":"2026-05-12T06:01:24.281809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2605.11328","last_updated":"2026-05-11T23:26:30Z","snapshot_observed_at":"2026-08-11T08:46:33.961285Z","submitted_at":"2026-05-11T23:26:30Z","title":"Epistemic Uncertainty for Test-Time Discovery","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:52:41.192353Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2605.11328"},"observation_digest":"sha256:4168431961557417f81543a9301b48240f2f2676f5fa21de48c04e78dc8eac32","observation_id":"3039b200-07d3-4b2c-a9be-e5fcab8a40e4","resolution":{"observed_at":"2026-05-13T01:57:06.101531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2606.05800","last_updated":"2026-06-04T07:29:43Z","snapshot_observed_at":"2026-08-14T20:29:34.506845Z","submitted_at":"2026-06-04T07:29:43Z","title":"SALT: When More Rollouts Don't Help in Group-Based Policy Optimization and How to Make Them Matter","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:53:22.159132Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2606.05800"},"observation_digest":"sha256:010efa08dd80c92c5ecd01461adad04e3430b0676900c37e9eb77d7b9c9bb650","observation_id":"1358ee36-5a8f-4a5b-a9b9-66951295ece0","resolution":{"observed_at":"2026-07-02T11:46:56.173296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:7110604158a66ec8114176e508618de77353427495058d75e5a06da6b887f329","observation_id":"92d15d31-edab-49ac-955e-6afb9bba302f","resolution":{"observed_at":"2026-07-04T07:59:40.656115Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2509.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09675","snapshot_observed_at":"2026-07-04T16:39:57.677897Z","title":"Cde: Curiosity-driven exploration for efficient reinforcement learning in large language models.arXiv preprint arXiv:2509.09675","venue":null,"work_id":"18513f12-7ca9-4d43-a8cb-9f784f40a803","year":2025},"citing_paper":{"arxiv_id":"2606.24994","last_updated":"2026-06-23T15:51:39Z","snapshot_observed_at":"2026-08-09T14:53:08.483711Z","submitted_at":"2026-06-23T15:51:39Z","title":"ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T00:23:16.499175Z"},"links":{"cited_paper":"/paper/2509.09675","citing_paper":"/paper/2606.24994"},"observation_digest":"sha256:e16b3e4ca0720f5b3b2c0f238e9bafd26e57cd5238687419b92c00bf9f3b7be7","observation_id":"59aabf2b-ef39-4e89-967b-6d107da89b62","resolution":{"observed_at":"2026-07-04T16:39:57.679442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09675/citation-record","integrity":"/paper/2509.09675/integrity","json":"/paper/2509.09675/citation-record.json","paper":"/paper/2509.09675"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-04T18:53:02.597599Z","title":"A survey of exploration methods in reinforcement learning.arXiv preprint arXiv:2109.00157,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.597599Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:12170c2c53a24e3533681cc8b467e0cb4dcfb55668b90367a8910f51a31089af","observation_id":"7c8d4574-d36e-4a66-9513-d4dc796d50d7","resolution":{"observed_at":"2026-08-04T18:53:02.597599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:02.820543Z","title":"std ´␣ ϕJpwpkq n,h ˇˇ1ďkďK (¯ . Elliptical (“count-based","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.820543Z"},"links":{"citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:0dd0a6e8fb1a0fca97a7ffad8ae6d6050311b6150a47187c67bb1a24a6096a37","observation_id":"7086f6d9-3732-48fc-84fc-8e693773f390","resolution":{"observed_at":"2026-08-04T18:53:02.820543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:02.813713Z","title":"Qwen3-4B-Base-GRPO","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.813713Z"},"links":{"citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:86683f8f970ac3a30277e03a3aa4c674b9568a1e517fecbd3e118925e0ccc735","observation_id":"5aa8ec28-2077-4742-851a-d95c0b788c38","resolution":{"observed_at":"2026-08-04T18:53:02.813713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-04T18:53:02.638102Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.arXiv preprint arXiv:2505.22617,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.638102Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:7d02914649975edacba128ad5e7d8b501345c7b9ba5c6a0a9983617905278d50","observation_id":"e18ab364-7475-43b4-9f0e-aa8b67c2eb79","resolution":{"observed_at":"2026-08-04T18:53:02.638102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03714","last_updated":"2025-07-07T04:11:47Z","snapshot_observed_at":"2026-08-14T07:48:23.592346Z","submitted_at":"2025-03-28T16:23:59Z","title":"Breach in the Shield: Unveiling the Vulnerabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03714","snapshot_observed_at":"2026-08-04T18:53:02.644861Z","title":"Breach in the shield: Unveiling the vulnera- bilities of large language models.arXiv preprint arXiv:2504.03714, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.644861Z"},"links":{"cited_paper":"/paper/2504.03714","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:fe3465d305caafd7b9301a11b1c75003d036d09f0b9abbc19048f833c15d2ac1","observation_id":"6747d781-40bb-453b-a586-a9ba2a630f5f","resolution":{"observed_at":"2026-08-04T18:53:02.644861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-04T18:53:02.672697Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence.arXiv preprint arXiv:2401.14196,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.672697Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:6f224206d21a608f605e084e354e017f0f332f2a5d3360ab5db27dd7beb580f5","observation_id":"b7a85f9e-f9a8-4575-8593-467edb25e281","resolution":{"observed_at":"2026-08-04T18:53:02.672697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-04T18:53:02.690293Z","title":"R-zero: Self-evolving reasoning llm from zero data.arXiv preprint arXiv:2508.05004,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.690293Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:a0d0ecf6d751aec6c2beefd4148685355d7f44ec6270fd95f09176d63e5237c5","observation_id":"edf8c7ba-09fc-4dea-9987-691406fe9548","resolution":{"observed_at":"2026-08-04T18:53:02.690293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T18:53:02.696442Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.696442Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:4d0e0dd19a97a66600c9e778f3da3386b2c5282e25dc903bc3661fb795dca975","observation_id":"82224b45-c9a0-41ba-b27b-66d47ad1791c","resolution":{"observed_at":"2026-08-04T18:53:02.696442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-15T12:04:28.662048Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-04T18:53:02.713848Z","title":"Continuous control with deep reinforcement learning.arXiv preprint arXiv:1509.02971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.713848Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:2c2c190ba578d71fec4fbabeb2750e39e580d87ffd3b5a48efe50ea93ac478a0","observation_id":"a6d24b4f-2202-4ed8-8b6c-22d35406aa26","resolution":{"observed_at":"2026-08-04T18:53:02.713848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-04T18:53:02.719173Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.719173Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:e3f086167b4c6464f1a58249940a1e1c5f767257c03af7cbf49e60107e0eb9f9","observation_id":"90686f68-f452-49b0-a015-954971bc96dc","resolution":{"observed_at":"2026-08-04T18:53:02.719173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T18:53:02.725388Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.725388Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:e0d8100475162e49fee175e2716f487f8867fc97b562497cff4be24425716607","observation_id":"c3fe07f1-8719-4bc0-9cad-4ef046aac618","resolution":{"observed_at":"2026-08-04T18:53:02.725388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T18:53:02.730852Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.730852Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:2f8451ceee4a2f775cb5448d96d63574061724e81e0f7d42f3266f1db45c5490","observation_id":"0d2781dd-027f-4a65-a4c0-b329ef2326e0","resolution":{"observed_at":"2026-08-04T18:53:02.730852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:02.736661Z","title":"On entropy control in llm-rl algorithms.arXiv preprint arXiv:2509.03493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.736661Z"},"links":{"citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:d77bba2ffe0ef20f41f1ecc859340e5e3634b709dc47a52961ccb7245a07e568","observation_id":"85d9f907-6cf2-486c-9306-6d340ed9c89a","resolution":{"observed_at":"2026-08-04T18:53:02.736661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08819","last_updated":"2024-06-27T16:30:32Z","snapshot_observed_at":"2026-08-13T23:11:17.543870Z","submitted_at":"2024-02-20T04:13:48Z","title":"Thermometer: Towards Universal Calibration for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08819","snapshot_observed_at":"2026-08-04T18:53:02.742636Z","title":"Thermometer: Towards universal calibration for large language models.arXiv preprint arXiv:2403.08819,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.742636Z"},"links":{"cited_paper":"/paper/2403.08819","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:7ba8a4de8446387e66d3e6535618691bb58e2dd1b509b9288155a10cc450d329","observation_id":"5f4aa9d9-897b-4962-9273-2271b2e68222","resolution":{"observed_at":"2026-08-04T18:53:02.742636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-04T18:53:02.748248Z","title":"Solving math word problems with process-and outcome-based feedback.arXiv preprint arXiv:2211.14275,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.748248Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:c5851c1cb4184f2d4ce7bc8eb6464ebec8d43cdd16b50c292d50d1f5bc811bfc","observation_id":"555c6c82-7c77-4038-a2f9-43400cb59813","resolution":{"observed_at":"2026-08-04T18:53:02.748248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00320","last_updated":"2024-06-29T05:14:04Z","snapshot_observed_at":"2026-08-12T23:32:18.777039Z","submitted_at":"2024-06-29T05:14:04Z","title":"LiteSearch: Efficacious Tree Search for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00320","snapshot_observed_at":"2026-08-04T18:53:02.763705Z","title":"Litesearch: Efficacious tree search for llm.arXiv preprint arXiv:2407.00320, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.763705Z"},"links":{"cited_paper":"/paper/2407.00320","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:f8d6e953e75c2b512d1e8b96a0e1fd107937f458a9ad445a8a5ef70266c6736e","observation_id":"f22aacd1-a65f-4627-9d38-08d962735cec","resolution":{"observed_at":"2026-08-04T18:53:02.763705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06508","last_updated":"2024-10-09T03:20:02Z","snapshot_observed_at":"2026-08-13T10:24:11.266424Z","submitted_at":"2024-10-09T03:20:02Z","title":"Towards Self-Improvement of LLMs via MCTS: Leveraging Stepwise Knowledge with Curriculum Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06508","snapshot_observed_at":"2026-08-04T18:53:02.770333Z","title":"Towards self-improvement of llms via mcts: Leveraging stepwise knowledge with curriculum preference learning.arXiv preprint arXiv:2410.06508, 2024c","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.770333Z"},"links":{"cited_paper":"/paper/2410.06508","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:292145be20b757f986c5ee64f25aef68be30a7b6983310202eaf9540ed1a2684","observation_id":"beefff04-48de-4cf9-b381-03c75111e970","resolution":{"observed_at":"2026-08-04T18:53:02.770333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T18:53:02.782542Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.782542Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:a003d44522ff50d9e22ab6dde09b43c5aa75d10d23df43c20cf4e5771f6393f8","observation_id":"c00dd1be-6d63-497a-aaf2-83d01e19e1ec","resolution":{"observed_at":"2026-08-04T18:53:02.782542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-04T18:53:02.789262Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.789262Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:37c9792b686bc66a5df7cd96903cb64d3aa68150d71931170b0d1ed0746ed009","observation_id":"14604fba-6511-4875-b9b9-6e734e0d09cb","resolution":{"observed_at":"2026-08-04T18:53:02.789262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-04T18:53:02.795969Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.795969Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:86b63ecfaa2bdda07bbcbb67b173aad83230d2cbfd380df4f45b5f5e267e0cd4","observation_id":"785be2f1-8e1f-4b8f-86da-ff8b432162eb","resolution":{"observed_at":"2026-08-04T18:53:02.795969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-08-14T13:11:59.992983Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08794","snapshot_observed_at":"2026-08-04T18:53:02.802208Z","title":"One token to fool llm-as-a-judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.802208Z"},"links":{"cited_paper":"/paper/2507.08794","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:23bf85ddd2c4cf4ffc70ac22b4d2320e5b8d540dac7e436a8adbc05a701f33c7","observation_id":"0f693e32-c32b-4e35-8cc7-c3c537d19128","resolution":{"observed_at":"2026-08-04T18:53:02.802208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15817","last_updated":"2025-06-09T21:22:15Z","snapshot_observed_at":"2026-08-15T10:16:02.613066Z","submitted_at":"2025-05-21T17:59:54Z","title":"Learning to Reason via Mixture-of-Thought for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15817","snapshot_observed_at":"2026-08-04T18:53:02.808040Z","title":"Learning to reason via mixture-of-thought for logical reasoning.arXiv preprint arXiv:2505.15817, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.808040Z"},"links":{"cited_paper":"/paper/2505.15817","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:f808f25d9b597b9a3f5d528c1a10cf6a018719e3090763546c2875fa35e4b07b","observation_id":"832c0674-f33c-4253-8d81-84f819a15d64","resolution":{"observed_at":"2026-08-04T18:53:02.808040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-08-15T12:53:06.624601Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-04T18:53:02.654971Z","title":"Alphazero-like tree-search can guide large language model decoding and training.arXiv preprint arXiv:2309.17179,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.654971Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:ca1e58b9435271ec7262afeae9d47eb707d60ee8215c37b148e01c678440a0d0","observation_id":"398b7170-af66-43e5-b8c6-f39c12d228aa","resolution":{"observed_at":"2026-08-04T18:53:02.654971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-08-15T16:01:07.680571Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19652","snapshot_observed_at":"2026-08-04T18:53:02.707977Z","title":"Self-rewarding vision-language model via reasoning decomposition.arXiv preprint arXiv:2508.19652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.707977Z"},"links":{"cited_paper":"/paper/2508.19652","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:e83bd5fd3c870167ebb02836915c67566490b93e52119c75e5c68168ee2a884b","observation_id":"b36915be-0427-4923-9bf1-971eaa09ee47","resolution":{"observed_at":"2026-08-04T18:53:02.707977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T18:53:02.666926Z","title":"Navigate the unknown: Enhancing llm reasoning with intrinsic motivation guided exploration.arXiv preprint arXiv:2505.17621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.666926Z"},"links":{"citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:84c8b5c6468ddce40ffb2bb76c70c1c0eae818b8a4d47446662f360d96d88a7e","observation_id":"d9bacd8f-e76d-40d2-82f6-9ca30d510465","resolution":{"observed_at":"2026-08-04T18:53:02.666926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-04T18:53:02.702231Z","title":"Tulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.702231Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:ac615b414af5149630649e1c2644317c863fd2991dc86cfc29c367ecdee0f717","observation_id":"1c617351-2487-4a29-9d57-4246570be9c3","resolution":{"observed_at":"2026-08-04T18:53:02.702231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T18:53:02.684631Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.684631Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:d2fe377b9a6914678d0562f7400d8e0ac9b6c958cd814512382132051ec68fa6","observation_id":"12a00344-c489-4e71-83da-94b86ecbb9da","resolution":{"observed_at":"2026-08-04T18:53:02.684631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T18:53:02.630026Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.630026Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:2656d1bcf04e2fdf920c402bc5dbe62d9a64da58f8994d31e286833e784688a0","observation_id":"5d9c5d8f-b005-415a-a257-49ea048cacfc","resolution":{"observed_at":"2026-08-04T18:53:02.630026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13957","last_updated":"2026-05-16T17:37:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:56:03Z","title":"Supervising the search process produces reliable and generalizable information-seeking agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13957","snapshot_observed_at":"2026-08-04T18:53:02.776951Z","title":"Guangzhi Xiong, Qiao Jin, Xiao Wang, Yin Fang, Haolin Liu, Yifan Yang, Fangyuan Chen, Zhixing Song, Dengyu Wang, Minjia Zhang, et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.776951Z"},"links":{"cited_paper":"/paper/2502.13957","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:f21c35fc0c7d34699b9220300fc29a4573899b666853337a2593d1308ce0c5aa","observation_id":"2fe00bae-31bc-4acd-938e-f62307b1658f","resolution":{"observed_at":"2026-08-04T18:53:02.776951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12735","last_updated":"2025-02-07T02:13:27Z","snapshot_observed_at":"2026-08-14T12:25:36.911347Z","submitted_at":"2025-01-22T09:12:09Z","title":"Online Preference Alignment for Language Models via Count-based Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12735","snapshot_observed_at":"2026-08-04T18:53:02.606163Z","title":"Online prefer- ence alignment for language models via count-based exploration.arXiv preprint arXiv:2501.12735,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.606163Z"},"links":{"cited_paper":"/paper/2501.12735","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:e4198fc7a135356454baaa70fb53a86782f8b20f63ac44e363818a6252917e24","observation_id":"f0ebcc62-be89-4ba5-b101-e6d25f04a06e","resolution":{"observed_at":"2026-08-04T18:53:02.606163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05973","last_updated":"2024-03-09T17:46:24Z","snapshot_observed_at":"2026-08-13T00:58:28.491853Z","submitted_at":"2024-03-09T17:46:24Z","title":"Calibrating Large Language Models Using Their Generations Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05973","snapshot_observed_at":"2026-08-04T18:53:02.754686Z","title":"Calibrating large language models using their generations only.arXiv preprint arXiv:2403.05973,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.754686Z"},"links":{"cited_paper":"/paper/2403.05973","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:ec045fe70c60b4bea1cc40fccce3ce7389b612663e947acd048005d839671e31","observation_id":"3cdec345-3fa4-4bd6-ba62-80192386feb1","resolution":{"observed_at":"2026-08-04T18:53:02.754686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15260","last_updated":"2025-08-21T05:48:38Z","snapshot_observed_at":"2026-08-12T17:10:09.978771Z","submitted_at":"2025-08-21T05:48:38Z","title":"Deep Think with Confidence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15260","snapshot_observed_at":"2026-08-04T18:53:02.660976Z","title":"Deep think with confidence.arXiv preprint arXiv:2508.15260,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.660976Z"},"links":{"cited_paper":"/paper/2508.15260","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:9b398dbda04bebe30664073dc4bbe4eea3c79f3f65b83b797bb1f21bc36a2bfc","observation_id":"c8f1606b-f184-41d0-b092-a942c03e5d23","resolution":{"observed_at":"2026-08-04T18:53:02.660976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T18:53:02.678938Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.678938Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:87fa881575820c4b51fec904003ea774d79fb489126ddd03c42c310922b2dddb","observation_id":"7fce78d2-28a7-4bd5-b754-c5491bdec338","resolution":{"observed_at":"2026-08-04T18:53:02.678938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-04T18:53:02.613187Z","title":"Exploration by random network distillation.arXiv preprint arXiv:1810.12894,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T18:53:02.613187Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2509.09675"},"observation_digest":"sha256:5f6a4aa23d3d52f4fd0a3f669756da2a41158a2895162c686f3518a5d609ac5f","observation_id":"5a58071c-5895-4ae0-ab48-1c5826335408","resolution":{"observed_at":"2026-08-04T18:53:02.613187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09675","last_updated":"2025-09-11T17:59:17Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T08:22:36.948935Z","submitted_at":"2025-09-11T17:59:17Z","title":"CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 11 inbound Pith citation observations for arXiv:2509.09675."}