{"as_of":"2026-08-09T19:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd11400749bc5a622c6d220d3d45745f70f949393d85642a5dd8bafee23e98ac","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:26:48.296848Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:53:10.631113Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:08.075019Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-08-04T10:53:10.631113Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:10.631113Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:68bffb25abd362b3934644402fd9489ed3b81e6d20471984c2e9aaed9a01d671","observation_id":"63ed6416-f211-42d3-8ae8-6792164f8643","resolution":{"observed_at":"2026-08-04T10:53:10.631113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-03T01:58:39.053103Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T17:58:38.234197Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:8793c9a3a8294faeb5c837d9723574bd3b97bf5f92a20960f97ba60b1bceeb7b","observation_id":"e5a95a1a-5436-40a1-9875-db81b3a9ba99","resolution":{"observed_at":"2026-05-09T06:55:42.926347Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-03T01:58:39.053103Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T02:09:39.645781Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:9489b50528ca54f364c3a3ac3fc71d8bd699d51ee1106a244a49fe2ae72b2fcb","observation_id":"da54ada4-7c1f-4b5b-8944-c9de425040ab","resolution":{"observed_at":"2026-05-11T03:55:54.508842Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.05112","last_updated":"2026-05-15T16:04:23Z","snapshot_observed_at":"2026-08-03T01:58:39.053103Z","submitted_at":"2026-05-06T16:44:38Z","title":"Rollout Pass-Rate Control: Steering Binary-Reward RL Toward Its Most Informative Regime","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T17:32:34.585808Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.05112"},"observation_digest":"sha256:8574dc4efa5fb57e9316b47526162041cf65e88655c17423a35a51a1286e6827","observation_id":"da2a00c6-4e88-4cb1-998e-660119840990","resolution":{"observed_at":"2026-05-19T17:32:41.453150Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.11636","last_updated":"2026-05-12T06:58:35Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:58:35Z","title":"Seir\\^enes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:49.761472Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.11636"},"observation_digest":"sha256:ec597eee5cea8d3f1cd8d9489672bd8c58b1fcf62d1ada85b84f5d1d09e1f015","observation_id":"50102c52-6333-46ce-867d-49c934cbcc78","resolution":{"observed_at":"2026-05-13T01:22:01.670232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.21467","last_updated":"2026-05-20T17:53:09Z","snapshot_observed_at":"2026-08-02T18:02:44.990875Z","submitted_at":"2026-05-20T17:53:09Z","title":"DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-21T05:24:46.545570Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.21467"},"observation_digest":"sha256:8aa49a8de2d14eb8953dbfa606062c8378640913c6596ac7b185a2ed6f7526db","observation_id":"48091707-a566-4411-ab25-00bddaffb930","resolution":{"observed_at":"2026-05-21T05:29:40.154298Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2605.22567","last_updated":"2026-05-21T14:47:52Z","snapshot_observed_at":"2026-07-06T23:32:54.127514Z","submitted_at":"2026-05-21T14:47:52Z","title":"LANG: Reinforcement Learning for Multilingual Reasoning with Language-Adaptive Hint Guidance","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-22T06:19:44.377733Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2605.22567"},"observation_digest":"sha256:1922f9606b05fad4aeaa6354937309cdd3db50a3a9f170ba777485d2f472deda","observation_id":"604f0662-faf6-49e7-87a6-41b31def1ce5","resolution":{"observed_at":"2026-05-22T06:21:10.335384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2606.13680","last_updated":"2026-06-11T17:59:52Z","snapshot_observed_at":"2026-07-06T23:52:23.981568Z","submitted_at":"2026-06-11T17:59:52Z","title":"Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T06:30:55.592334Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2606.13680"},"observation_digest":"sha256:31efcb106a25555f75e06e73fea8bfabe30587186fe869f7a2075d01518e68a0","observation_id":"102dbb83-68ec-464a-a929-a3df65e0e30e","resolution":{"observed_at":"2026-07-03T15:28:33.912680Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-09T07:41:33.424534Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:d434279984509cfe160f5f673cdd8277ac2c8c0060b3ac59e2923158df4eff34","observation_id":"5093c845-1be9-4bd5-a621-1039b93d1e57","resolution":{"observed_at":"2026-07-03T20:48:56.192377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-02T04:58:05.165698Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-25T20:55:15.784610Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:58deadee84f78d9c521a0eee6b47c76409b08b56e75c5067fd22048e7f3d8b68","observation_id":"49501d2a-a3eb-4771-bbb5-a115b9e2e2b4","resolution":{"observed_at":"2026-07-04T20:00:08.076804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":"2507.02841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-07-04T20:00:08.075019Z","title":"arXiv preprint arXiv:2507.02841 , year=","venue":null,"work_id":"505a6600-5d71-4c01-86c3-4ea91b231a87","year":2025},"citing_paper":{"arxiv_id":"2606.25450","last_updated":"2026-06-25T16:37:45Z","snapshot_observed_at":"2026-08-02T04:58:05.165698Z","submitted_at":"2026-06-24T06:26:02Z","title":"The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-26T05:29:21.598397Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2606.25450"},"observation_digest":"sha256:7ae8ed2020ee75071fd9b54ab380c04a28b465a5162ade9847a2306c4d985df3","observation_id":"e162964d-6e0c-4a53-96a2-b7f75a8d13c6","resolution":{"observed_at":"2026-07-04T13:09:50.539506Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02841","snapshot_observed_at":"2026-08-01T12:54:36.127455Z","title":"Stephint: Multi-level stepwise hints enhance reinforcement learning to reason","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-07T08:18:38.032175Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:36.127455Z"},"links":{"cited_paper":"/paper/2507.02841","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:8ee456c734a36f57a17c492d871d2748bb8e92b0b3a4bce67a5f77cfb2102057","observation_id":"7b0118de-0224-4485-af04-c1dad64f514f","resolution":{"observed_at":"2026-08-01T12:54:36.127455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02841/citation-record","integrity":"/paper/2507.02841/integrity","json":"/paper/2507.02841/citation-record.json","paper":"/paper/2507.02841"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T20:26:45.550459Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.550459Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:dcf55db170a72b87680415774490ffb5153087f822259d188c009fdc93af23c2","observation_id":"53902c7f-ceaa-4cd8-ae04-df45ca4878b2","resolution":{"observed_at":"2026-08-06T20:26:45.550459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-06T20:26:45.878265Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.878265Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:7f088f9e4adf34319f5a23e6cb168f590597084a5c965ec62723a9812cde6e91","observation_id":"657f7dfc-fbbc-40ff-9958-12be451463f3","resolution":{"observed_at":"2026-08-06T20:26:45.878265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T20:26:46.011935Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.011935Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:3e937de0e15f833a7a6e5a5c7d059f6b4a29a0a9b3db4a52ce53ff349a98a9b5","observation_id":"93a0d590-15ee-4f88-9130-d17931502e63","resolution":{"observed_at":"2026-08-06T20:26:46.011935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-06T20:26:46.372789Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.372789Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:7a5b5a67012722c1af791822d1ff9efc39bc1d5ad5177d6108e1f268b5229746","observation_id":"5086abbf-6a0c-47bf-89e1-13bc93dfb8a8","resolution":{"observed_at":"2026-08-06T20:26:46.372789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T20:26:46.458931Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.458931Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:bcb1e990955a894ba5e6a5eed9f98e8431100c60f93d265660fd668187b1de99","observation_id":"806c79e2-5a96-4689-90ea-3f25cfc6655e","resolution":{"observed_at":"2026-08-06T20:26:46.458931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T20:26:46.553671Z","title":"Open-reasoner- zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.553671Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:ec0c210b107da0efe002a95f0df9cc9184908a07a98898129b80ed853b5c9012","observation_id":"b383e2a9-380d-49a0-bf16-fe6abb213d44","resolution":{"observed_at":"2026-08-06T20:26:46.553671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T20:26:46.651273Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.651273Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:11848483590bbb05743b133d58b361adc0626ab1ae5ec543549b196184e9a8a3","observation_id":"200c78f7-87fc-4304-90aa-fd1b3003eee1","resolution":{"observed_at":"2026-08-06T20:26:46.651273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T20:26:46.745830Z","title":"Under- standing r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.745830Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:929c4ebf78ab2d823f8a22db90bf2b6b04a8d09211c579a95a0dedccf38608c2","observation_id":"6ac67542-5f34-49c7-b98a-53504476c0d9","resolution":{"observed_at":"2026-08-06T20:26:46.745830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-06T20:26:46.857127Z","title":"David JC MacKay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.857127Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:af94f21fbaeaaee25fd767581c996eb5504ac891fd25be6a81346992f46ca710","observation_id":"c1e0f7d7-0436-40f6-9d38-34d50fec9880","resolution":{"observed_at":"2026-08-06T20:26:46.857127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:48.603795Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"a6474cae-d9ed-4cd2-8821-d0b92e8834cf","year":1928},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.065513Z"},"links":{"citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:b583f18b32500104cbc374e3f75fc9482c1da01478d140dba83f1c72793ccce0","observation_id":"7aaf876e-1be8-4460-aac9-ebda4c7a5c30","resolution":{"observed_at":"2026-08-06T20:26:48.607497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-08T15:29:26.223468Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-06T20:26:47.156279Z","title":"Trust region policy optimiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.156279Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:1a124405d78fa4d037d8f9c51ea517f44523114cb38452150096713198cc62b1","observation_id":"1f6ef865-02fe-46fb-a6e1-f9f437debb17","resolution":{"observed_at":"2026-08-06T20:26:47.156279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T20:26:47.348775Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.348775Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:b202dd18c7c6b15cd903e951e48426d371a778b64f121b004e35e2db1c375d09","observation_id":"70addeb1-6245-49eb-9b54-4269a32733bd","resolution":{"observed_at":"2026-08-06T20:26:47.348775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T20:26:47.488611Z","title":"github.io/blog/qwq-32b/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.488611Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:790f017b2d0b78ff04900bef3c4c19a394804a8da4a9b54ab14eac7af8ccdeaa","observation_id":"93f8688a-5a95-4f2c-8ade-b482b719f4a2","resolution":{"observed_at":"2026-08-06T20:26:47.488611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18478","last_updated":"2025-06-02T14:26:19Z","snapshot_observed_at":"2026-08-09T13:23:20.877505Z","submitted_at":"2024-11-27T16:19:00Z","title":"Beyond Examples: High-level Automated Reasoning Paradigm in In-Context Learning via MCTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18478","snapshot_observed_at":"2026-08-06T20:26:47.740169Z","title":"Be- yond examples: High-level automated reasoning paradigm in in-context learning via mcts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.740169Z"},"links":{"cited_paper":"/paper/2411.18478","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:e79fea8e91c4966c51bb1a48971bdf292097635d08a1ea11197775afd90d2b37","observation_id":"1fcf59b5-b3a2-4d95-ab77-06c710e09d8c","resolution":{"observed_at":"2026-08-06T20:26:47.740169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-06T20:26:47.836925Z","title":"Learning to reason under off-policy guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.836925Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:fad02c332473c2e5d819ca0b0bf3f78fdb7a722305cac446a6d27f61675ea745","observation_id":"1a7f977f-f13f-4f48-a2e8-ee4c534fe2b4","resolution":{"observed_at":"2026-08-06T20:26:47.836925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T20:26:47.918660Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.918660Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:a04fd0ff0826527873effc290e5b03f6a0223c9eaac54ac228c08cc8236c65ea","observation_id":"188137c9-c0d6-41d2-bfc0-301584891c98","resolution":{"observed_at":"2026-08-06T20:26:47.918660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T20:26:48.035446Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:48.035446Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:293ca557cd8d011025ead0ea149353da0e7edc1ef3fcf25f2ee160b1f0d585df","observation_id":"3148fa1c-30e0-4b98-acfb-40c08c2a5224","resolution":{"observed_at":"2026-08-06T20:26:48.035446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T20:26:48.085634Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:48.085634Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:c4f32f2e46e92117832b66f0af482319a73d64eff71a873b5a75261d84f7d77d","observation_id":"1551ff57-ec59-4a4b-b813-29883e73e219","resolution":{"observed_at":"2026-08-06T20:26:48.085634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T20:26:48.151553Z","title":"Simplerl-zoo: Investigat- ing and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:48.151553Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:e5f0a3a874d5ffbc813c4f9cd85d162a9bb4eb873d161a6537f0accb4c102f69","observation_id":"59db289d-0fdf-468d-b436-3c737347f318","resolution":{"observed_at":"2026-08-06T20:26:48.151553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:26:48.594175Z","title":null,"venue":null,"work_id":"6639c1dd-ff66-49dc-9faa-16212612c714","year":2003},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:48.296848Z"},"links":{"citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:06742ce1591504512430926be787557b9a10b8bdcfcf1a49a929d3242a6c360f","observation_id":"23ad57c4-f146-45a3-9a69-58be11b90cb3","resolution":{"observed_at":"2026-08-06T20:26:48.597951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T20:26:47.242484Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":1948,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.242484Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:3edd86af011bddbb588d334660d91df30f5472dd2b76ae9a72be16c4a348140b","observation_id":"26de7637-ffdd-4a6c-869b-47c3972b6a63","resolution":{"observed_at":"2026-08-06T20:26:47.242484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14830","last_updated":"2024-02-16T23:44:38Z","snapshot_observed_at":"2026-08-01T01:16:04.260529Z","submitted_at":"2024-02-16T23:44:38Z","title":"Orca-Math: Unlocking the potential of SLMs in Grade School Math","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14830","snapshot_observed_at":"2026-08-06T20:26:46.985350Z","title":"Orca-math: Unlocking the potential of slms in grade school math","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.985350Z"},"links":{"cited_paper":"/paper/2402.14830","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:04e023f3790f5943f6e0bad35537eab9ec7f4f58e602cf6265c3ba5989327256","observation_id":"7c032893-f8dc-4e88-9ad2-bbd2e931f2cd","resolution":{"observed_at":"2026-08-06T20:26:46.985350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11468","last_updated":"2025-04-10T16:54:05Z","snapshot_observed_at":"2026-08-05T02:57:13.928237Z","submitted_at":"2025-04-10T16:54:05Z","title":"SFT or RL? An Early Investigation into Training R1-Like Reasoning Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11468","snapshot_observed_at":"2026-08-06T20:26:45.633252Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.633252Z"},"links":{"cited_paper":"/paper/2504.11468","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:316376e58cdbf8eb93dfeedec024cedc31a97763bd59a05ab790c2db3e6362c5","observation_id":"42f467dd-ab2f-4c2b-8753-a8a7af1b99b5","resolution":{"observed_at":"2026-08-06T20:26:45.633252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-06T20:26:45.833877Z","title":"Rea- soning with exploration: An entropy perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.833877Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:c0e8620b7ed39d2ab0ca0e674a11eab6454d3039cd93951b3254aa91f2322b81","observation_id":"b04e2f4d-a1b8-467c-8b58-6f70f84d6524","resolution":{"observed_at":"2026-08-06T20:26:45.833877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17120","last_updated":"2024-10-29T17:02:45Z","snapshot_observed_at":"2026-07-06T17:09:19.909685Z","submitted_at":"2023-12-28T16:55:40Z","title":"MathPile: A Billion-Token-Scale Pretraining Corpus for Math","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17120","snapshot_observed_at":"2026-08-06T20:26:47.613196Z","title":"Generative ai for math: Part i–mathpile: A billion-token-scale pretrain- ing corpus for math","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:47.613196Z"},"links":{"cited_paper":"/paper/2312.17120","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:fc1d506c0ea9f5d422526a241cb4671e52c8928ec304314f317fc0cd8c885ca4","observation_id":"91e9def5-e837-48b2-b972-09dd171b7349","resolution":{"observed_at":"2026-08-06T20:26:47.613196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:26:46.134022Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.134022Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:965e68250fd0be52ddcc3037f213ffd260259328bcb9adb010cfc0f90870938c","observation_id":"06f84943-4e26-4301-82be-f15ef631ab84","resolution":{"observed_at":"2026-08-06T20:26:46.134022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:26:46.255880Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.255880Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:1a5cb3909e388d2de3528479acc1f3ebb3665f9c037587768679f273d1bd2e01","observation_id":"5f09d8f1-7c70-4020-8387-322b242215ba","resolution":{"observed_at":"2026-08-06T20:26:46.255880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T20:26:45.719770Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:45.719770Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:c8bfa61f42f1ed7f1e59d7dabf0e27e0b5ae19ba37251ed9ac4c3340594a9537","observation_id":"98de604d-3fd3-4c47-9df0-62ca1eb1dfdc","resolution":{"observed_at":"2026-08-06T20:26:45.719770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 12 inbound Pith citation observations for arXiv:2507.02841."}