{"as_of":"2026-08-16T21:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:84f3fff854d1406bb9af4d66b7d6d827a95825db590b0d06efd625a4b12f8001","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:23:54.829237Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:48:30.873942Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:09:40.662689Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-16T06:39:12.822315Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:13.293921Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:aff1eb58cde03865a88e4de8cfffb69d16c631384171e63cf102070ea7308e31","observation_id":"ccf703d3-489a-4cbe-adaf-5d000ca5b6bf","resolution":{"observed_at":"2026-05-21T13:14:10.971468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-08-03T03:33:43.695859Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-16T06:39:12.822315Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:43.695859Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:8e77af5acec185963bd4af9a61abe6672d56cb761a4df57c7d9174ef6fcf3fa2","observation_id":"09b23c32-fb30-4c1a-a096-9dbebe7a4b2b","resolution":{"observed_at":"2026-08-03T03:33:43.695859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2605.08283","last_updated":"2026-05-08T07:38:35Z","snapshot_observed_at":"2026-08-11T12:55:00.545868Z","submitted_at":"2026-05-08T07:38:35Z","title":"HTPO: Towards Exploration-Exploitation Balanced Policy Optimization via Hierarchical Token-level Objective Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:42.836549Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2605.08283"},"observation_digest":"sha256:ec2822236bdc1488bf4decce77f0eeaa28e3f4200b59a372e0274845aca6663b","observation_id":"5c05e544-ae55-45ef-b807-6a1da0229726","resolution":{"observed_at":"2026-05-12T00:51:14.596330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2605.11328","last_updated":"2026-05-11T23:26:30Z","snapshot_observed_at":"2026-08-11T08:46:33.961285Z","submitted_at":"2026-05-11T23:26:30Z","title":"Epistemic Uncertainty for Test-Time Discovery","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:52:41.192353Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2605.11328"},"observation_digest":"sha256:826625988350dd28246238e0a315834d1abc8df82e75e5b6d0f4823df04492ac","observation_id":"f4f5a4c4-890c-4235-bb9b-38ae12da4741","resolution":{"observed_at":"2026-05-13T01:57:06.044731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:fc390f9ba2721fe729079b978df018971a81b4ae59e678d3cdb1148d6d677ae3","observation_id":"efaff5c3-2482-45f9-8ded-02939fa1f10b","resolution":{"observed_at":"2026-07-03T20:38:56.101152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2606.20967","last_updated":"2026-06-18T22:07:39Z","snapshot_observed_at":"2026-08-14T01:18:40.141890Z","submitted_at":"2026-06-18T22:07:39Z","title":"Formalizing Task-Space Complexity for Zero-Shot Generalization","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-26T17:28:55.356850Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2606.20967"},"observation_digest":"sha256:b3619b312f4579efbf8b31ef41c49ae62b02fdcd49d8b104795064f5b763ece1","observation_id":"09d9d026-81c7-47ef-bb80-983a28743583","resolution":{"observed_at":"2026-07-04T03:59:32.894403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.00125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-07-04T08:09:40.662689Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning.arXiv preprint arXiv:2509.00125, 2025a","venue":null,"work_id":"68acc8f7-f4aa-4c6d-aaf1-15bdbd5e2b43","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:f8a9413683c6fec1d04e4c7136371be47cee6a06920008c44cc3c3ec5639c815","observation_id":"7648875b-3f7a-4c46-af90-34ae6c91614b","resolution":{"observed_at":"2026-07-04T08:09:40.664145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00125","snapshot_observed_at":"2026-08-11T04:48:30.873942Z","title":"Know when to explore: Difficulty-aware certainty as a guide for llm reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09898","last_updated":"2026-08-10T17:45:44Z","snapshot_observed_at":"2026-08-16T04:57:45.185607Z","submitted_at":"2026-08-10T17:45:44Z","title":"Consilience for Verifier-Free Test-Time Scaling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T04:48:30.873942Z"},"links":{"cited_paper":"/paper/2509.00125","citing_paper":"/paper/2608.09898"},"observation_digest":"sha256:51a3de2878276ceeaa505403ecdd18ff4ea67cfa80a41463e95a569f884c0f05","observation_id":"0da969a2-3a7c-41e3-a361-258f7d9934ab","resolution":{"observed_at":"2026-08-11T04:48:30.873942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00125/citation-record","integrity":"/paper/2509.00125/integrity","json":"/paper/2509.00125/citation-record.json","paper":"/paper/2509.00125"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:52.012864Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.012864Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:0bb094ff42eccabaee94fcb23f6443082d4ba3d39c84722c280525b72c13e41d","observation_id":"0fae64bf-bc87-4977-87d0-02d7f71eaf7e","resolution":{"observed_at":"2026-08-05T14:23:52.012864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T14:23:52.044378Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.044378Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:aae41ce79cc71d446969b34b339f266f556d621f0407940012b8aa26c0fe7704","observation_id":"9202f34b-3cb7-442f-97a4-4eab7dba5831","resolution":{"observed_at":"2026-08-05T14:23:52.044378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T14:23:52.097658Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.097658Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:eaf798695395ab5b9a46c795e865299a62e49131df3a084189edd40a06b7106d","observation_id":"4fd8135b-080c-4eec-bf07-a9e4ab3cbfe9","resolution":{"observed_at":"2026-08-05T14:23:52.097658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T14:23:52.153387Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.153387Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:be0133adfbbc57c2c40752d4ee6caaf98f85b7248ad4eccaff47e3412a58d9dd","observation_id":"34c9fb5e-b0bb-4a94-9879-00c3ce7d357a","resolution":{"observed_at":"2026-08-05T14:23:52.153387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:58.514175Z","title":"Let’s verify step by step","venue":null,"work_id":"d42e0208-ddc0-42d3-8ccd-5c44bde4241d","year":2023},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.193635Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:3aadf5679dfef62cb5beec953d2d2bb1f9bb01e58345d3a152c9c1d99a2f3a7f","observation_id":"82b20f8d-b312-4c59-b42d-59e511803bf2","resolution":{"observed_at":"2026-08-05T14:23:58.685654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-14T10:08:59.886019Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-05T14:23:52.252596Z","title":"Math- shepherd: Verify and reinforce llms step-by-step without human annotations.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.252596Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:ac81b986b67d0de9902426fd95958be9f488f296f087ad5d9491d764d7303f7d","observation_id":"fb93fe45-4a55-4b3c-8e64-3b59a4fb0a79","resolution":{"observed_at":"2026-08-05T14:23:52.252596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:52.474556Z","title":"Scalable best-of-n selection for large language models via self-certainty","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.474556Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:3786a012dd0ae066af953b24c0a0557f96810528eb6803e5817fd4e22b85207e","observation_id":"3703a958-d47e-45d0-92bb-5518f6b39972","resolution":{"observed_at":"2026-08-05T14:23:52.474556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11533","last_updated":"2025-01-20T15:17:24Z","snapshot_observed_at":"2026-08-14T12:39:10.034760Z","submitted_at":"2025-01-20T15:17:24Z","title":"The impact of intrinsic rewards on exploration in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11533","snapshot_observed_at":"2026-08-05T14:23:52.574469Z","title":"The impact of intrinsic rewards on exploration in reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.574469Z"},"links":{"cited_paper":"/paper/2501.11533","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:ec982f8dc0dd3208b902131b317b85d303286ef9ab77fe8158e5482e8d519001","observation_id":"21250019-abda-44ec-8a32-2a4851ebe388","resolution":{"observed_at":"2026-08-05T14:23:52.574469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:58.365085Z","title":"Thompson sampling: An asymptotically optimal finite-time analysis","venue":null,"work_id":"be458213-17cb-42fe-b018-7948563e9683","year":2012},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.607689Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:69a486922e8c13f5fcd9675fe2cf0ba2fa14f95c9979aae14c9fc3d3b471169f","observation_id":"ea1186f2-c4dc-4e56-a502-2c850b501999","resolution":{"observed_at":"2026-08-05T14:23:58.434368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:58.167564Z","title":"Thompson sampling for contextual bandits with linear payoffs","venue":null,"work_id":"847e47d0-f9eb-437e-9f44-276928f82b6e","year":2013},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.684821Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:497937ae040a14b0129c48c96c3deb3c3b59dfc2eb0b883e0237b6a411d5f386","observation_id":"71f55c8d-7cfa-4b66-b4e4-a509853d5451","resolution":{"observed_at":"2026-08-05T14:23:58.287010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02189","last_updated":"2020-03-04T17:03:56Z","snapshot_observed_at":"2026-08-05T18:34:50.706165Z","submitted_at":"2020-03-04T17:03:56Z","title":"Exploration-Exploitation in Constrained MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02189","snapshot_observed_at":"2026-08-05T14:23:52.737271Z","title":"Exploration-exploitation in constrained mdps.arXiv preprint arXiv:2003.02189, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.737271Z"},"links":{"cited_paper":"/paper/2003.02189","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:12a8813f348fb4ad5c1f6386b68753670e6bad9507d52465543e0f4a200a8ec2","observation_id":"4060531c-1847-4585-b001-198f32c05dd6","resolution":{"observed_at":"2026-08-05T14:23:52.737271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.972647Z","title":"Why is posterior sampling better than optimism for reinforcement learning? In ICML, 2017","venue":null,"work_id":"ab1016d7-2026-4442-91a8-9cf494e867f6","year":2017},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.809809Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:c6959b16345fc51749c3d9388ecdc5d872ac160cf736ec105d55ad33d5d84083","observation_id":"822ae0fc-6db9-407b-be99-fa09a6948950","resolution":{"observed_at":"2026-08-05T14:23:58.007796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.792603Z","title":"First return, then explore","venue":null,"work_id":"70bc97b3-8f44-419e-ad15-4e8493cd111b","year":2021},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.860872Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:b1ee82cb49196c28b9e9db91e6e72b9d73dcaec2c3cc7620e48999ddee102d12","observation_id":"b1e214fe-a27f-4f1e-8e68-16d1520ea192","resolution":{"observed_at":"2026-08-05T14:23:57.908440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.549812Z","title":"Automatic goal generation for reinforcement learning agents","venue":null,"work_id":"859e8861-21ad-4217-bb30-f39c2ddb1777","year":2018},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.915005Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:d12ab1dd8ae5f0578580c72b4bac5a01951faa06e0346a9ea6b03c49c47d5572","observation_id":"5cfca35f-e4c9-4323-aab3-7ff3f6200c07","resolution":{"observed_at":"2026-08-05T14:23:57.672989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:52.986538Z","title":"MIT press Cambridge, 1998","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:52.986538Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:fc2cd7890116973615545c3961a5d259de4f1ff286211f6ee962b27e8e3f627e","observation_id":"e0896c7a-5d24-49cc-99f5-bbf3454a21f9","resolution":{"observed_at":"2026-08-05T14:23:52.986538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.322775Z","title":"Adaptiveε-greedy exploration in reinforcement learning based on value differences","venue":null,"work_id":"84cf0d86-0fc8-4991-97bb-74c45de5181e","year":2010},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.029151Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:860e98bb69d0735e9811026003bb3cb6cbc67dd742d32ed5cbd42f5a6ceeaff7","observation_id":"4b22afa6-dbbf-4e5e-a976-d323cbf41029","resolution":{"observed_at":"2026-08-05T14:23:57.397962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:57.171082Z","title":"# exploration: A study of count-based exploration for deep reinforcement learning","venue":null,"work_id":"3faf2f62-48c0-46ba-b162-203a6bbafb1e","year":2017},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.107117Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:942d1f6b69660bee5e8f33c5d409247acdd943823fc396b991da02683b299641","observation_id":"af537e40-7b37-47cf-8762-26f1ddde1bed","resolution":{"observed_at":"2026-08-05T14:23:57.233013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.958523Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":"7ca559b4-847c-430b-a03e-97c696f34808","year":2016},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.159916Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:0ac33bec524a76c0508f7366caf88db388be3fb92cc937f6a45bc55830cb3c0a","observation_id":"625027fc-5657-457b-bc6a-a25ba0a7f7ea","resolution":{"observed_at":"2026-08-05T14:23:57.077614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.735880Z","title":"Curious model-building control systems","venue":null,"work_id":"fee7794c-46e5-40dc-a334-5c2bfb72ebb5","year":1991},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.219109Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:3692e2abb210d218fc278561f84c3c3b6bf8965ed92ef9c8a443732312ee2414","observation_id":"47b9055b-4018-4590-9ea4-cd41539fb231","resolution":{"observed_at":"2026-08-05T14:23:56.843868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.503041Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":"51db2bc7-242f-4b00-9fa1-262c503fc878","year":2017},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.288373Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:c829366acefc374001d217206ec586fa415985be65f4689544807e4197ea55a2","observation_id":"f64fc493-eefc-44ad-931a-d5febad69903","resolution":{"observed_at":"2026-08-05T14:23:56.624749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T14:23:53.349740Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.349740Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:ded213d0238ac136ee0abeb0a06fcff4af0570f506055deac96cacb0cca73f4f","observation_id":"071b3708-a6bb-4d24-9a98-dd9e66e6f994","resolution":{"observed_at":"2026-08-05T14:23:53.349740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.288202Z","title":"Planning to explore via self-supervised world models","venue":null,"work_id":"02655704-e194-4a45-b66e-05d0a8676f7b","year":2020},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.445822Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:3d82a8e20141dae4bc354cde4a76ef95026ab0d7638e3a27cdb48c6958e14783","observation_id":"b194bb3f-0f88-4cef-83ff-3c494a524657","resolution":{"observed_at":"2026-08-05T14:23:56.400136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:56.007922Z","title":"Vime: Variational information maximizing exploration","venue":null,"work_id":"379cb323-7088-405a-8cfe-7f7d0495d866","year":2016},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.513064Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:f5717611abafdd4cc8512707242fb023439a55ee7b094e53fe4b877c33b479d5","observation_id":"954ec9c2-13a1-461f-8f5b-5848e91dbe33","resolution":{"observed_at":"2026-08-05T14:23:56.128094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:55.701525Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"c5c24cf4-6d7d-4d1b-9bd6-6caf29719481","year":2019},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.586478Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:23327a0fc776fd33d7d3459adf7fead05f93ac268e850a2fd24bf309b9057dfb","observation_id":"b7cc4687-085e-40d0-bed4-45c222baf6b1","resolution":{"observed_at":"2026-08-05T14:23:55.855227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:55.414694Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":"c5046f7c-cf9e-46ab-9c6d-d81aa6ff7bae","year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.655512Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:029bdcdf42e7bee4409f2faff30e75bc2b6a3e83071e14ae5aee176e90ed4bea","observation_id":"d57a21b2-6589-4b9f-a40b-01630ae61e98","resolution":{"observed_at":"2026-08-05T14:23:55.542844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-05T14:23:53.726913Z","title":"Learning to reason without external rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.726913Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:d448b042f29a5ff105a4ad23760f3ab8dcee3a268ca74ac679cc53c068a4971e","observation_id":"9420cb17-f685-4dd4-a6d8-48a6600f33fa","resolution":{"observed_at":"2026-08-05T14:23:53.726913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05812","last_updated":"2025-05-18T13:41:33Z","snapshot_observed_at":"2026-08-16T12:43:05.556743Z","submitted_at":"2025-04-08T08:48:51Z","title":"Right Question is Already Half the Answer: Fully Unsupervised LLM Reasoning Incentivization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05812","snapshot_observed_at":"2026-08-05T14:23:53.805378Z","title":"Right question is already half the answer: Fully unsupervised llm reasoning incentivization.arXiv preprint arXiv:2504.05812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.805378Z"},"links":{"cited_paper":"/paper/2504.05812","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:da5c2dec639d382dbc21f115015e1521c5548e3ca1bc4294401d01b75bdd18e7","observation_id":"747bd84f-aaff-4c49-8042-15dc9311dd0b","resolution":{"observed_at":"2026-08-05T14:23:53.805378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-08-13T03:09:24.809367Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15134","snapshot_observed_at":"2026-08-05T14:23:53.864174Z","title":"The unreasonable effectiveness of entropy minimization in llm reasoning.arXiv preprint arXiv:2505.15134, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.864174Z"},"links":{"cited_paper":"/paper/2505.15134","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:d6a3a887bc791ce8188fad57f929884203a5280dba8173562adf27832b53dad9","observation_id":"91c343ed-07cd-4656-85ed-de4239c3f1c1","resolution":{"observed_at":"2026-08-05T14:23:53.864174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-16T21:37:36.363888Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-05T14:23:53.913129Z","title":"One-shot entropy minimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.913129Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:0de5b35ce9efe18f0efbda6f71d011bea8cfd09ba38888da6e6170d2430aaea6","observation_id":"72352bc2-0201-46b3-9b37-71dd8e686483","resolution":{"observed_at":"2026-08-05T14:23:53.913129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-16T21:10:35.590654Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T14:23:53.993294Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.993294Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:126d25772ba3afe3894a726df386aa4436adf455f68e2e4dbf8009ab17101ae8","observation_id":"f2e1034f-eb4b-4ef7-9838-69608525c0c4","resolution":{"observed_at":"2026-08-05T14:23:53.993294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-15T16:34:53.919919Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-08-05T14:23:54.061991Z","title":"First return, entropy-eliciting explore.arXiv preprint arXiv:2507.07017, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.061991Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:24e4f81794c0f2b8990af316b48adabde0bdbf9aa826e4236472073c39fe7d6a","observation_id":"7d8e9ecb-8f18-4653-b893-fc7ccde05aad","resolution":{"observed_at":"2026-08-05T14:23:54.061991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-08-16T12:42:28.642795Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T14:23:54.165008Z","title":"Reasoning with exploration: An entropy perspective.arXiv preprint arXiv:2506.14758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.165008Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:d5b45cdd60ac32791e5d14c2b41aac7f45195db6c2b05b32e673d514d09fd879","observation_id":"f036f048-214b-4d9e-8a89-9046536ab732","resolution":{"observed_at":"2026-08-05T14:23:54.165008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-05T14:23:54.263620Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.263620Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:d21687f65fd07fb0c9059f8288d536e1daec243ccc380440b03fab6fd725b946","observation_id":"77947edf-38ea-4181-93e3-f094562744d5","resolution":{"observed_at":"2026-08-05T14:23:54.263620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-16T15:54:40.056766Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-05T14:23:54.346422Z","title":"Free process rewards without process labels.arXiv preprint arXiv:2412.01981, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.346422Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:83a0fb6e0381006868cb4ff5941a15bacd1782febe01acc4b320f55c0d67969e","observation_id":"c944a4df-f17b-4859-8da6-eafd9de83834","resolution":{"observed_at":"2026-08-05T14:23:54.346422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-05T14:23:54.429131Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv:2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.429131Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:1ee7d247cf38c70501e4490f4b59ed4200977d59f7635759c30415d65c717183","observation_id":"6ace7843-b82d-4429-a83c-473e3d336d9d","resolution":{"observed_at":"2026-08-05T14:23:54.429131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T14:23:54.506644Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.506644Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:1b5f2e33734030278a1b72f2ac1d036295d50bf633c166acebc781d0e9e2a095","observation_id":"1e3a05f2-725d-472a-89fd-6cf0e83dd2eb","resolution":{"observed_at":"2026-08-05T14:23:54.506644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T14:23:54.563362Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.563362Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:340cccb2182d06ac46a13919c5f2ab166a5d9890dd1def75d753d8c6000c4721","observation_id":"7bcc21ec-a01b-4b73-b936-4c3833198956","resolution":{"observed_at":"2026-08-05T14:23:54.563362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T14:23:54.656234Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.arXiv preprint arXiv:2505.22617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.656234Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:2b47ef34580ed21c400e6f20d53fb6db1e3c6e564bc387209216018fa4baa858","observation_id":"5a84f266-0bad-4488-ae18-149dd2857216","resolution":{"observed_at":"2026-08-05T14:23:54.656234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:54.766364Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.766364Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:597cc3989e39a88115af4597e7785684015ec00b12c50a5e1ea4c3bf6855c0a9","observation_id":"1f7d0dc9-5dd4-47be-8d47-40168e4891c3","resolution":{"observed_at":"2026-08-05T14:23:54.766364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:54.804613Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.804613Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:2b7cdaa73039ae65bf5abdd3985e8e19fc8230a8329c3f0d950ff31ea685e462","observation_id":"7ab1850b-1883-4ced-b777-0144ee09d814","resolution":{"observed_at":"2026-08-05T14:23:54.804613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:23:55.157207Z","title":"Math-Verify: Math Verification Library.https://github.com/huggingface/math-verify, 2025","venue":null,"work_id":"45af7fff-c042-4a0c-a93b-7753e5f1d39b","year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:54.829237Z"},"links":{"citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:aea8264ef41c4cecb9136fa729a1e9237b115e4803d9c6c9d4bf9cb62db6806e","observation_id":"3480521a-824d-43ae-a716-80da712b82e7","resolution":{"observed_at":"2026-08-05T14:23:55.242466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T01:18:07.433185Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 8 inbound Pith citation observations for arXiv:2509.00125."}