{"as_of":"2026-08-18T07:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fc14c1fc35ddbfeb054dbd7e0c53c30ef3f4ccff10eeb60b0d608cc00267431","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:53:29.001062Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:30:38.055667Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T07:59:40.189087Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14363","snapshot_observed_at":"2026-08-15T18:30:38.055667Z","title":"Improving RL exploration for LLM reasoning through retrospective replay.arXiv preprint arXiv:2504.14363,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-17T17:58:03.429114Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T18:30:38.055667Z"},"links":{"cited_paper":"/paper/2504.14363","citing_paper":"/paper/2506.19767"},"observation_digest":"sha256:a23e857f6860e65b05760b3860df5ffb707262c9e44ab9cb07c6e1ce701e55f6","observation_id":"a57d2fe3-68d0-4906-9adc-01e65938bc09","resolution":{"observed_at":"2026-08-15T18:30:38.055667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"cited_work":{"arxiv_id":"2504.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14363","snapshot_observed_at":"2026-07-04T07:59:40.189087Z","title":"Improving rl exploration for llm reasoning through retrospective replay","venue":null,"work_id":"9e421577-4e9e-4262-9013-2ffdf1935d80","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2504.14363","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:68e3b14d2618ee9c452efb513bf75aba5a259981649f6630d40a2c4d1c8c92e1","observation_id":"331e8f51-bedd-44b1-8469-cd6695202c97","resolution":{"observed_at":"2026-05-18T00:02:25.295695Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"cited_work":{"arxiv_id":"2504.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14363","snapshot_observed_at":"2026-07-04T07:59:40.189087Z","title":"Improving rl exploration for llm reasoning through retrospective replay","venue":null,"work_id":"9e421577-4e9e-4262-9013-2ffdf1935d80","year":2025},"citing_paper":{"arxiv_id":"2604.18530","last_updated":"2026-05-27T05:59:47Z","snapshot_observed_at":"2026-08-13T13:27:48.320533Z","submitted_at":"2026-04-20T17:26:00Z","title":"OGER: A Robust Offline-Guided Exploration Reward for Hybrid Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T04:29:21.897215Z"},"links":{"cited_paper":"/paper/2504.14363","citing_paper":"/paper/2604.18530"},"observation_digest":"sha256:6d8e314e8ad07c0eb28c7aebd121ddbc9c1e0365f9a92d580133b618b162069b","observation_id":"8d570112-a7fc-4c0c-84ae-491828bceca0","resolution":{"observed_at":"2026-05-11T11:56:12.821899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"cited_work":{"arxiv_id":"2504.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14363","snapshot_observed_at":"2026-07-04T07:59:40.189087Z","title":"Improving rl exploration for llm reasoning through retrospective replay","venue":null,"work_id":"9e421577-4e9e-4262-9013-2ffdf1935d80","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":266,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2504.14363","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:bb6cee9b296fb0d815971206597c431ba42c04fd150d224af03b4624ba558bc3","observation_id":"0d92ba2d-2def-4264-a3d6-9daafaa5fb0a","resolution":{"observed_at":"2026-07-01T20:56:13.562994Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"cited_work":{"arxiv_id":"2504.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14363","snapshot_observed_at":"2026-07-04T07:59:40.189087Z","title":"Improving rl exploration for llm reasoning through retrospective replay","venue":null,"work_id":"9e421577-4e9e-4262-9013-2ffdf1935d80","year":2025},"citing_paper":{"arxiv_id":"2606.03087","last_updated":"2026-06-02T03:17:34Z","snapshot_observed_at":"2026-08-13T22:16:38.264751Z","submitted_at":"2026-06-02T03:17:34Z","title":"Learning to Solve, Forgetting to Retain: Correct-Set Turnover in RLVR","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-06-28T11:50:00.954670Z"},"links":{"cited_paper":"/paper/2504.14363","citing_paper":"/paper/2606.03087"},"observation_digest":"sha256:edf8526387381444f82890ecc26e7e17c530640e57ce5a793365fe4d5cae3737","observation_id":"f71fc0eb-23d5-43eb-abf0-9f60c6da2b44","resolution":{"observed_at":"2026-07-02T01:36:25.167562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"cited_work":{"arxiv_id":"2504.14363","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14363","snapshot_observed_at":"2026-07-04T07:59:40.189087Z","title":"Improving rl exploration for llm reasoning through retrospective replay","venue":null,"work_id":"9e421577-4e9e-4262-9013-2ffdf1935d80","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2504.14363","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:e301b96bd35c7f0bc8e7848c95b0dc19ef19fffa88106ee89fd978f9401f1f42","observation_id":"f3695488-aca2-48e0-b879-1b07bbbd95a5","resolution":{"observed_at":"2026-07-04T07:59:40.190471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.14363/citation-record","integrity":"/paper/2504.14363/integrity","json":"/paper/2504.14363/citation-record.json","paper":"/paper/2504.14363"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:27.505944Z","title":"IEEE Signal Processing Magazine 34(6), 26–38 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.505944Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:a1bd686b9a93129c57c50e6b42fe61d3ad1abdd33a5dd7719badcb4a2b597987","observation_id":"888524d1-e700-4d13-b272-6e7915a7e389","resolution":{"observed_at":"2026-08-16T11:53:27.505944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T11:53:27.575439Z","title":"CoRR abs/2204.05862 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.575439Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:ac9a617a84f72e8436be329a4c9583a2892046fb317e52a77f55793b94d7c4d2","observation_id":"dae19bd0-8887-42d9-9b17-6e1071ebc1e6","resolution":{"observed_at":"2026-08-16T11:53:27.575439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T11:53:27.666657Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.666657Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:a6cd60cf9a8420a56a5900ec91506e0045a8492699176c5d19f8dc10989e4662","observation_id":"c90a7971-3e79-4e58-bc1b-850676693ab8","resolution":{"observed_at":"2026-08-16T11:53:27.666657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-16T11:53:27.671172Z","title":"arXiv preprint arXiv:2401.02954 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.671172Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:6369f3650c8e0ea2d282b817b0a76146cfca96917afd46ed3babb0b22b58d41a","observation_id":"9c39bf08-9c78-4d61-9ebe-bcffa6d48bb5","resolution":{"observed_at":"2026-08-16T11:53:27.671172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12505","last_updated":"2025-05-22T07:59:33Z","snapshot_observed_at":"2026-08-14T18:48:33.412673Z","submitted_at":"2024-12-17T03:20:00Z","title":"DocFusion: A Unified Framework for Document Parsing Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12505","snapshot_observed_at":"2026-08-16T11:53:27.675801Z","title":"arXiv preprint arXiv:2412.12505 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.675801Z"},"links":{"cited_paper":"/paper/2412.12505","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:7cc0921bb01e6ffae47b2b4bc9ed6cd373171863d6a9fe0e81ab8f061dcc13e0","observation_id":"d20b8933-9a52-46b1-bfc6-e781c9329f0a","resolution":{"observed_at":"2026-08-16T11:53:27.675801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11280","last_updated":"2022-07-22T18:08:16Z","snapshot_observed_at":"2026-08-16T16:43:58.705164Z","submitted_at":"2022-07-22T18:08:16Z","title":"PanGu-Coder: Program Synthesis with Function-Level Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11280","snapshot_observed_at":"2026-08-16T11:53:27.679663Z","title":"arXiv preprint arXiv:2207.11280 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.679663Z"},"links":{"cited_paper":"/paper/2207.11280","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:c30a3757b0ad8ae9bebc76ad2f328558c8c9e6825081426ea4ac503fa53e398d","observation_id":"42bc350b-17e5-423b-92a7-b384c0860eac","resolution":{"observed_at":"2026-08-16T11:53:27.679663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T11:53:27.684280Z","title":"ArXiv abs/2110.14168 (2021), https: //api.semanticscholar.org/CorpusID:239998651 Improving RL Exploration for LLM Reasoning through Retrospective Replay 11","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.684280Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:dff75dff0e25018a8ac04e142a1584b9b45317a9e5975f1e64345763b0134c5d","observation_id":"ad4659b5-0974-46d4-a975-452382807278","resolution":{"observed_at":"2026-08-16T11:53:27.684280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cimca.2008.32","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:29.030884Z","title":"In: 2008 Interna- tional Conference on Computational Intelligence for Modelling Control Automa- tion","venue":null,"work_id":"ec368570-c813-4ce1-ae65-47f5ff36a957","year":2008},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.687722Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:19ae77cb9245156390c058791fd938bbf7005d21db214bd01755a9ce4dfd5c69","observation_id":"65229ffc-8d53-46e3-b205-549ceff1b21c","resolution":{"observed_at":"2026-08-16T11:53:29.036959Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00750","last_updated":"2025-02-21T08:00:10Z","snapshot_observed_at":"2026-08-16T13:03:43.346878Z","submitted_at":"2024-11-01T17:18:45Z","title":"Mitigating Tail Narrowing in LLM Self-Improvement via Socratic-Guided Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00750","snapshot_observed_at":"2026-08-16T11:53:27.692181Z","title":"ArXiv abs/2411.00750 (2024), https://api.semanticscholar.org/ CorpusID:273798221","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.692181Z"},"links":{"cited_paper":"/paper/2411.00750","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:22dd74f6f98963189f9c434e2f1faa7bc747b844ffad77cc2e2e977e67e92156","observation_id":"8b9976a4-4f52-4bd9-aa9d-cf85a28bd283","resolution":{"observed_at":"2026-08-16T11:53:27.692181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:27.696732Z","title":"arXiv preprint arXiv:2407.06153 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.696732Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:09f5716c4f9ed00426708656517392c638d0438998074e3d5b2cb4cb2f2c9d7a","observation_id":"f00bda77-aa71-440a-8c60-b776ea5265cf","resolution":{"observed_at":"2026-08-16T11:53:27.696732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:30.296008Z","title":"In: Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":"95677423-7adf-4f4a-9af6-460c8da39c11","year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.729125Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:b0738cf461b9c6d070a8b692028df6410c737ecc9d495160f58ca9b477b70bef","observation_id":"ae96fd29-0008-44bd-beab-b6cc578ff7bf","resolution":{"observed_at":"2026-08-16T11:53:30.299883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00438","last_updated":"2024-05-01T10:43:55Z","snapshot_observed_at":"2026-08-16T13:56:19.917879Z","submitted_at":"2024-05-01T10:43:55Z","title":"MetaRM: Shifted Distributions Alignment via Meta-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00438","snapshot_observed_at":"2026-08-16T11:53:27.844350Z","title":"arXiv preprint arXiv:2405.00438 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.844350Z"},"links":{"cited_paper":"/paper/2405.00438","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:ed2f78e85047aaf10ecd30bee6978e005adbad6c4fefd47ff6ea31d4223e7194","observation_id":"ce400777-20f3-462d-ac3f-b7f3fcd0fb7a","resolution":{"observed_at":"2026-08-16T11:53:27.844350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01191","last_updated":"2023-08-06T01:40:59Z","snapshot_observed_at":"2026-08-17T03:24:58.084249Z","submitted_at":"2023-08-02T14:56:01Z","title":"Towards Understanding the Capability of Large Language Models on Code Clone Detection: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01191","snapshot_observed_at":"2026-08-16T11:53:27.946663Z","title":"arXiv preprint arXiv:2308.01191 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.946663Z"},"links":{"cited_paper":"/paper/2308.01191","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:cc749df275ac62c405bb59038b3d12daa4d6acc0162c6612a4cb06057a621d0d","observation_id":"03c2a41e-5bc4-4e4c-a7df-49adf5076bd3","resolution":{"observed_at":"2026-08-16T11:53:27.946663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:27.950609Z","title":"arXiv preprint arXiv:2506.02672 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.950609Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:8c5341adda7fb9215e869551138f703e47582bb199451b785a99c46332fe6294","observation_id":"c00eeada-e0ed-49f8-86fe-a6ec1ce69bcc","resolution":{"observed_at":"2026-08-16T11:53:27.950609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:30.284889Z","title":"In: Proceedings of the 62nd Annual Meeting of the AssociationforComputationalLinguistics(Volume1:LongPapers).pp.1932–1945 (2024)","venue":null,"work_id":"05fb9c08-68b9-403a-8c07-8c6bcbcff845","year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.954831Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:79fefc2f97e3b44efb9714a01692be7304aa19c2591658fc05565279b7c5ba70","observation_id":"3ded2841-43b0-4cf3-9a7e-c520a900f59e","resolution":{"observed_at":"2026-08-16T11:53:30.288728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:30.272840Z","title":"Nature590, 580 – 586 (2020),https://api.semanticscholar.org/ CorpusID:216552951","venue":null,"work_id":"c0591892-ceba-47d2-b49c-7c1af3889115","year":2020},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.957910Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:bc39b24b5a272cc6386e2a829e262287f0bb6711c1d5714d68014502a022cd78","observation_id":"a4f13fcd-9947-40fd-92d0-73e41fcf66b6","resolution":{"observed_at":"2026-08-16T11:53:30.276945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:30.165416Z","title":"In: Proceedings of the 41st International Conference on Machine Learning","venue":null,"work_id":"dc85a9e1-9b05-4d0f-9d6d-4f13c5ce74ff","year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.961503Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:fc0f8bb49f4e86fced8278c6fb37df8be06d108e609562c54c2af205215b419f","observation_id":"265801ab-340f-4118-a497-9cccdf90e407","resolution":{"observed_at":"2026-08-16T11:53:30.231147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:53:27.965567Z","title":"arXiv preprint arXiv:2501.12948 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.965567Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:91e577d596c6ff8a34283df896f5097218fb28fb74959fc7f47eeaf3d75aa8e2","observation_id":"b5a32ec2-5821-47b7-bbf0-a158e84ef373","resolution":{"observed_at":"2026-08-16T11:53:27.965567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:30.126153Z","title":null,"venue":null,"work_id":"705479f7-a2f2-48b6-9e01-362faf132e93","year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.969974Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:f3014ebf41f6ddd4a0d7437a68983c2b758cff33f89920d8bcffb8e4ddf1bc31","observation_id":"eefee861-05aa-4a28-b84a-77bf10127813","resolution":{"observed_at":"2026-08-16T11:53:30.130543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:30.115238Z","title":"In: Vanschoren, J., Yeung, S","venue":null,"work_id":"62c2780c-20ac-4893-8fe6-02848751548f","year":2021},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.973774Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:bd313ab99ed45a051175e6fa18cf8a3a4364cc255a2e22572dad3efb5438f097","observation_id":"48a7c01a-d34b-4642-a506-bddcf65291cd","resolution":{"observed_at":"2026-08-16T11:53:30.118878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-16T11:53:27.977900Z","title":"ArXiv abs/2103.03874 (2021), https://api.semanticscholar.org/CorpusID: 232134851","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:27.977900Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:eea96d8af7b5729fbe09b0547ee22a5abf90d11ed91ba488cbc327ccf79fdc6c","observation_id":"7b9dcbfb-6158-4163-9e86-7b9800b51638","resolution":{"observed_at":"2026-08-16T11:53:27.977900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-08-16T11:53:28.013293Z","title":"arXiv preprint arXiv:2212.10403 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.013293Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:abd1c84f885292dde1b025c163071ea5f89e0da8296b5a256a2076685a074c39","observation_id":"9055ac67-6aae-419c-95a0-8be5bed2262c","resolution":{"observed_at":"2026-08-16T11:53:28.013293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01044","last_updated":"2025-06-14T04:29:00Z","snapshot_observed_at":"2026-08-16T13:13:35.622045Z","submitted_at":"2024-10-01T20:05:51Z","title":"RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning","version":2},"cited_work":{"arxiv_id":"2410.01044","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01044","snapshot_observed_at":"2026-08-16T11:53:29.508818Z","title":"RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning","venue":"cs.AI","work_id":"fcdcd4fe-1db0-447d-8f60-c67f0a7729cf","year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.109352Z"},"links":{"cited_paper":"/paper/2410.01044","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:7fb9a388ebf84f749ad8581beb9a9c80902d8f2baed665d1a3eea2a34fbe8e0f","observation_id":"7a2d2248-5edb-4f01-a135-7b470cc0818d","resolution":{"observed_at":"2026-08-16T11:53:29.552762Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-08-14T15:51:49.712613Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-16T11:53:28.162206Z","title":"arXiv preprint arXiv:2310.06452 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.162206Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:7156c503cac63a4571968441e0d5a9366c278a7353011305b8ac2153301eaf13","observation_id":"2e2a4f09-b6db-4598-92c3-e9807baa9d1a","resolution":{"observed_at":"2026-08-16T11:53:28.162206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-16T12:54:10.475592Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-16T11:53:28.167820Z","title":"arXiv preprint arXiv:2502.21321 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.167820Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:45ea631782abca610533a6690d200b694b83caa52b56077e15b7551d2e565cc5","observation_id":"25a5fd15-d033-42ca-bac4-4b1d4b32e08d","resolution":{"observed_at":"2026-08-16T11:53:28.167820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:28.174446Z","title":"Information Fusion85, 1–22 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.174446Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:9b32462ce1eeed5f61c5a699b43c7364d338800a1dcdbbf4d4c4d729a06defc0","observation_id":"b9c4d114-ae70-4143-b99d-e46c18016fa9","resolution":{"observed_at":"2026-08-16T11:53:28.174446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-16T11:53:28.180369Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.180369Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:0ae5ef4d2d303e90769a1e8c37484b9ee9e09f9eef0cf1fc123d3f42d1dca3e4","observation_id":"1896f1dd-c6fb-48f3-b105-f6967430cbcd","resolution":{"observed_at":"2026-08-16T11:53:28.180369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07274","last_updated":"2018-11-26T04:56:31Z","snapshot_observed_at":"2026-08-15T10:58:31.329286Z","submitted_at":"2017-01-25T11:52:11Z","title":"Deep Reinforcement Learning: An Overview","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07274","snapshot_observed_at":"2026-08-16T11:53:28.185715Z","title":"arXiv preprint arXiv:1701.07274 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.185715Z"},"links":{"cited_paper":"/paper/1701.07274","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:f230c58fd9e9bf08789284f107abdddf520f0752278073307722bb3b2846c008","observation_id":"f60984d5-12cf-40a0-889c-d2d0327c1bd5","resolution":{"observed_at":"2026-08-16T11:53:28.185715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04349","last_updated":"2023-11-13T03:49:27Z","snapshot_observed_at":"2026-08-16T15:17:34.306721Z","submitted_at":"2023-07-10T05:18:18Z","title":"RLTF: Reinforcement Learning from Unit Test Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04349","snapshot_observed_at":"2026-08-16T11:53:28.190874Z","title":"arXiv preprint arXiv:2307.04349 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.190874Z"},"links":{"cited_paper":"/paper/2307.04349","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:49149b21aeca95e0bb7297a352ce718d9b8a9d558dcf984a51f7b716b99967e3","observation_id":"d67fe6a5-165f-4abe-981a-cdc3bc643bc2","resolution":{"observed_at":"2026-08-16T11:53:28.190874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08568","last_updated":"2025-05-27T07:40:36Z","snapshot_observed_at":"2026-08-16T15:23:56.097387Z","submitted_at":"2023-06-14T15:18:48Z","title":"WizardCoder: Empowering Code Large Language Models with Evol-Instruct","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08568","snapshot_observed_at":"2026-08-16T11:53:28.195335Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.195335Z"},"links":{"cited_paper":"/paper/2306.08568","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:b48f2853a642a504322cb81b880a97e48d981b37c72621b58c9f48e6f0f0a351","observation_id":"b834e9ad-e8c2-4d10-8381-da9a0ba90d6f","resolution":{"observed_at":"2026-08-16T11:53:28.195335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02523","last_updated":"2025-02-07T15:02:21Z","snapshot_observed_at":"2026-08-16T01:51:50.738591Z","submitted_at":"2025-02-04T17:45:32Z","title":"Brief analysis of DeepSeek R1 and its implications for Generative AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02523","snapshot_observed_at":"2026-08-16T11:53:28.200209Z","title":"arXiv preprint arXiv:2502.02523 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.200209Z"},"links":{"cited_paper":"/paper/2502.02523","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:87852be59a7450a43c8121211104725dbbed4ce7fdb79f572d8f308f4387b5e9","observation_id":"4196ed8a-44ca-45b0-8c1b-b0e3c47716de","resolution":{"observed_at":"2026-08-16T11:53:28.200209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:28.258352Z","title":"In: 2018 IEEE Inter- national Conference on Robotics and Automation (ICRA)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.258352Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:195b29e9e8ed0bc4c3da0b9d0bc157f840e4fc3e65303be3ea61708685137c66","observation_id":"ec987063-8bc8-4f1c-8f08-1107e78c04e4","resolution":{"observed_at":"2026-08-16T11:53:28.258352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:28.394078Z","title":"arXiv preprint arXiv:2407.11511 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.394078Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:217c3c85701e8957e6c61905f370ff96edc92dd34ad6c148d145847893b40b6b","observation_id":"b74eb59b-54e3-4ada-ae5b-0b7b012fce14","resolution":{"observed_at":"2026-08-16T11:53:28.394078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-16T11:53:28.457662Z","title":"arXiv preprint arXiv:2308.12950 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.457662Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:b59b1c0cb7ab930ccf09e9c63c1c74aab6baefce6e23ff31e64de6c0ebcdbd22","observation_id":"de719de5-add6-4a7a-aa2d-16575cc7cd27","resolution":{"observed_at":"2026-08-16T11:53:28.457662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-16T11:53:28.462546Z","title":"arXiv preprint arXiv:1511.05952 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.462546Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:b01b878237f4029fc6df7f95749a163ec78bd4f50539540495dde32f2d1fec5d","observation_id":"98c32d55-ab36-466a-a87f-bc3f7c533e1b","resolution":{"observed_at":"2026-08-16T11:53:28.462546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-16T11:53:28.512230Z","title":"arXiv preprint arXiv:1506.02438 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.512230Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:e255b895e4aab7c5e4c21dcb84cb9a0e5aa32b20ca2825e92bc42d09796920f9","observation_id":"667eed7b-7bc1-4c79-9e4e-437d47d7f5e1","resolution":{"observed_at":"2026-08-16T11:53:28.512230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T11:53:28.596337Z","title":"arXiv preprint arXiv:1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.596337Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:6b1137d1ddbd04b2ac0e11592c39f636cdf68fe5911376eff75469048715ea16","observation_id":"52cc8e12-af0e-4e6a-b088-e953c55ea7b2","resolution":{"observed_at":"2026-08-16T11:53:28.596337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:28.600249Z","title":"5-thinking: Advancing superb reasoning models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.600249Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:1d97736fafab3cdb0181b095eaf12dbce8d583724f3a84974cf82367a71abf37","observation_id":"9db5262c-478d-4508-abde-356ab74bef36","resolution":{"observed_at":"2026-08-16T11:53:28.600249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T11:53:28.603999Z","title":"ArXiv abs/2402.03300 (2024), https://api.semanticscholar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.603999Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:097f675ddde3b7b76465eec8ae72f523c3888d63f7ddf2dfa7529ff0bacf35a5","observation_id":"f4bc0226-3566-42ed-aba4-52742dfa2fda","resolution":{"observed_at":"2026-08-16T11:53:28.603999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:30.097973Z","title":"In: The 2023 Conference on Empirical Methods in Natural Language Processing","venue":null,"work_id":"83e8b85e-4fb5-423f-8160-561133ab10ac","year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.608387Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:f7e3d0e0120b658189de7afd20a20f2dc1a6a3c72ddec5f4d5862e62ccb3c6b5","observation_id":"f232fc04-9978-43c8-8f7e-0226eb9bcb16","resolution":{"observed_at":"2026-08-16T11:53:30.101836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13816","last_updated":"2023-07-19T19:55:31Z","snapshot_observed_at":"2026-08-17T14:37:55.930583Z","submitted_at":"2023-01-31T18:02:26Z","title":"Execution-based Code Generation using Deep Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13816","snapshot_observed_at":"2026-08-16T11:53:28.614182Z","title":"arXiv preprint arXiv:2301.13816 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.614182Z"},"links":{"cited_paper":"/paper/2301.13816","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:16bfeb7d39952d4da0d944a7872594a5641404bbab1f4709b157705b913ae2c1","observation_id":"dfe5a085-9bf6-49bb-bcf9-4e0876a6106a","resolution":{"observed_at":"2026-08-16T11:53:28.614182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:29.949291Z","title":"Advances in neural informa- tion processing systems12 (1999)","venue":null,"work_id":"ef377cb1-0b90-48e7-a3a7-abefbe7fbb5c","year":1999},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.689683Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:78bd90e56be8bc349e14528710f078e14b0e96a72807d96bfe033b25b8e85f12","observation_id":"85e0fc10-7300-46e5-98b4-581cc48cf3a4","resolution":{"observed_at":"2026-08-16T11:53:30.047980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03379","last_updated":"2024-05-06T11:33:12Z","snapshot_observed_at":"2026-08-16T16:55:34.524752Z","submitted_at":"2024-05-06T11:33:12Z","title":"Reverse Forward Curriculum Learning for Extreme Sample and Demonstration Efficiency in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03379","snapshot_observed_at":"2026-08-16T11:53:28.697223Z","title":"arXiv preprint arXiv:2405.03379 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.697223Z"},"links":{"cited_paper":"/paper/2405.03379","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:a60e2509cddaa20fdccc713cfe7ebf4dbfe7dce620053b8d1dc1ca153f97108c","observation_id":"562cef5c-f270-45ac-8046-207313ef9b73","resolution":{"observed_at":"2026-08-16T11:53:28.697223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:29.897720Z","title":null,"venue":null,"work_id":"1d2cb79c-838e-4840-b9f1-78ae825c257b","year":1992},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.702216Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:49162157bfd9519999a512216eb6e6d74c155cb3d84f1c1f4fbffbc67379262d","observation_id":"32e0b9d7-d87f-4c01-975a-4981ca8b7e02","resolution":{"observed_at":"2026-08-16T11:53:29.901092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T11:53:28.707518Z","title":"arXiv preprint arXiv:2307.09288 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.707518Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:679da5c66160820e885679e998cf6e92fbc40cf5e5d42b4ff0bb91bc63fb6826","observation_id":"32f7067e-076a-4510-b437-f9e204aa0d67","resolution":{"observed_at":"2026-08-16T11:53:28.707518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-16T11:53:28.711624Z","title":"arXiv preprint arXiv:2211.14275 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.711624Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:67387afb1805ff109cefd56312a704ea7bde38eb09e9b4d83e10cb47222ad37e","observation_id":"3a8e414d-0b82-4ddc-a9a5-3eaa050741c2","resolution":{"observed_at":"2026-08-16T11:53:28.711624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-16T14:28:08.540549Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-16T11:53:28.737965Z","title":"arXiv preprint arXiv:2401.06080 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.737965Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:889871f8a1cbac8fcb80f868834ebb0210c09b0b4247956296ebed211eb973e5","observation_id":"6a10ab00-4e0a-4284-89eb-e8ac65cf2a98","resolution":{"observed_at":"2026-08-16T11:53:28.737965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-16T12:50:20.333530Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-16T11:53:28.847092Z","title":"arXiv preprint arXiv:2503.10460 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.847092Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:6a31de4d6c1bc9cef720e53f08ccf6a019e1b40a9db415797dc75bbfc5017f51","observation_id":"61e3575d-57e1-43c4-ac9a-d246f320caf0","resolution":{"observed_at":"2026-08-16T11:53:28.847092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:28.851183Z","title":"Machine learning8, 229–256 (1992)","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.851183Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:1f392b80b9c2545e2e98b51a0c8291126b3fd45bf715255f295c5508bbb956a6","observation_id":"28577e6f-3437-4add-90e9-300765c13701","resolution":{"observed_at":"2026-08-16T11:53:28.851183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04065","last_updated":"2025-06-04T15:31:46Z","snapshot_observed_at":"2026-08-13T19:00:44.799706Z","submitted_at":"2025-06-04T15:31:46Z","title":"Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04065","snapshot_observed_at":"2026-08-16T11:53:28.855634Z","title":"arXiv preprint arXiv:2506.04065 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.855634Z"},"links":{"cited_paper":"/paper/2506.04065","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:0daa77328adf117dbb4618949c78f244412e9f9a4d67a97f017b48f67470d921","observation_id":"c4fcf402-90c7-4a45-a758-3bc594580228","resolution":{"observed_at":"2026-08-16T11:53:28.855634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:29.879804Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":"624ba7d3-24a5-4ad1-b8a8-a6151b0f1b2f","year":2024},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.860151Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:34f1bfbd8f5099d782eddcd782d3a95cca0be25817ac2a46352bcfee2e7428c8","observation_id":"a571a8ea-e785-4453-ad81-2414c8c6a3d3","resolution":{"observed_at":"2026-08-16T11:53:29.883416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.06668","last_updated":"2023-02-02T00:11:58Z","snapshot_observed_at":"2026-08-16T17:56:43.312126Z","submitted_at":"2021-09-14T13:16:33Z","title":"Exploration in Deep Reinforcement Learning: From Single-Agent to Multiagent Domain","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.06668","snapshot_observed_at":"2026-08-16T11:53:28.864222Z","title":"arXiv preprint arXiv:2109.06668 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.864222Z"},"links":{"cited_paper":"/paper/2109.06668","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:9ed63c15cd0df41857f5a0c4b73547c99db18c73b77df23c7a94d7782cf7abcc","observation_id":"a016837c-4a05-42e1-b30e-e793c6fd24c5","resolution":{"observed_at":"2026-08-16T11:53:28.864222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:28.869017Z","title":"arXiv preprint arXiv:2505.17793 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.869017Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:9dff920dac3bc5701fc84a3292e2f201dc1cc57a60bd7a3629c27bb79859acce","observation_id":"ede8af13-74e9-4136-b940-c3d979966938","resolution":{"observed_at":"2026-08-16T11:53:28.869017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01275","last_updated":"2018-04-30T04:24:26Z","snapshot_observed_at":"2026-08-14T20:07:22.164941Z","submitted_at":"2017-12-04T06:03:26Z","title":"A Deeper Look at Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01275","snapshot_observed_at":"2026-08-16T11:53:28.872617Z","title":"arXiv preprint arXiv:1712.01275 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.872617Z"},"links":{"cited_paper":"/paper/1712.01275","citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:57d3f2d3f86248b53bc6ab854d451f622dd9d15251929c41635cf6555ff4f8ea","observation_id":"455a8c2b-08a9-48e3-9529-729c736bc6d6","resolution":{"observed_at":"2026-08-16T11:53:28.872617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:29.869157Z","title":null,"venue":null,"work_id":"a230f806-bce1-42f2-933f-8fe8bd0bd27d","year":null},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:28.928556Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:9bc167af669084fd95f4f70eda27506ed93502636b255e02ba90d84f2929e900","observation_id":"bff13c8d-45e2-4636-a8c6-262d0a021569","resolution":{"observed_at":"2026-08-16T11:53:29.872604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:53:29.846592Z","title":"In: NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following (2023)","venue":null,"work_id":"d189afc7-5325-47b5-ace0-28f43c6465f7","year":2023},"citing_paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:53:29.001062Z"},"links":{"citing_paper":"/paper/2504.14363"},"observation_digest":"sha256:70383549e0281bbc8adaf02d3c64f25de2ab98c5b53c1b309f0246e04766cbe7","observation_id":"6421c666-6154-4714-ba74-d565060ac54b","resolution":{"observed_at":"2026-08-16T11:53:29.859319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14363","last_updated":"2025-07-05T09:43:33Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T12:22:03.663299Z","submitted_at":"2025-04-19T17:40:04Z","title":"Improving RL Exploration for LLM Reasoning through Retrospective Replay"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":45,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 6 inbound Pith citation observations for arXiv:2504.14363."}