{"as_of":"2026-08-13T05:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89756af4d82e55dcf0b528fee2a8a6e56fdac0da41588bc6a86ab5d61df952e0","coverage":[{"denominator":93,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":93,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:01:24.353008Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:17:38.690339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T18:17:33.758346Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-08-06T12:17:38.690339Z","title":"arXiv preprint arXiv:2506.08989 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21929","last_updated":"2025-07-29T15:45:50Z","snapshot_observed_at":"2026-08-12T14:28:09.954806Z","submitted_at":"2025-07-29T15:45:50Z","title":"Libra: Large Chinese-based Safeguard for AI Content","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:17:38.690339Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2507.21929"},"observation_digest":"sha256:6c3f68178112b8a271fc64ce27cfd61d935d5192b9a92a2f53060b4cc711d5a4","observation_id":"6ce4099e-64e1-4d5f-bb86-20d23d32d5b1","resolution":{"observed_at":"2026-08-06T12:17:38.690339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":193,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:b1c331ca23e18128291e33342c46bc4e4220909a7ce7d8238aea31a8b0f66b95","observation_id":"aada9b5e-40ca-4420-be05-92b822b7db85","resolution":{"observed_at":"2026-05-18T19:21:48.776855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":299,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:5baec3969cbf7925873ed5cf6dfa62cee37a05b3cdf8a2cb3fb1277208908134","observation_id":"33f605ae-eee2-4ce0-8cbf-94d14178471f","resolution":{"observed_at":"2026-05-18T00:02:24.823728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-08-04T16:07:33.895807Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-12T18:46:01.485214Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:33.895807Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:f86778fb3b37244aadf8f8037d75a3b70fbd9658af542ee0e08ebbccf7cd671d","observation_id":"6776643c-97a0-4199-9eb2-0fd15a3547b6","resolution":{"observed_at":"2026-08-04T16:07:33.895807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2601.04809","last_updated":"2026-05-04T13:55:24Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T10:42:04Z","title":"SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T16:24:04.132572Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2601.04809"},"observation_digest":"sha256:693c620c75e74d3f64183e0f85e5fe5f60d4548892362b54e98a85e3aeb92a8d","observation_id":"8fbca871-fffc-476e-ac85-e9ceb31743d2","resolution":{"observed_at":"2026-05-16T16:28:05.689821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2601.14004","last_updated":"2026-04-14T03:49:06Z","snapshot_observed_at":"2026-08-11T17:12:54.016914Z","submitted_at":"2026-01-20T14:23:23Z","title":"Locate, Steer, and Improve: A Practical Survey of Actionable Mechanistic Interpretability in Large Language Models","version":4},"reference_index":182,"source":"pdf_text","source_observed_at":"2026-05-16T12:39:57.398423Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2601.14004"},"observation_digest":"sha256:ea63a29fb9c15167d1838aa6df1d2df834210d743dde5364c80fd881dc21ac76","observation_id":"70ec431f-26c0-44d1-a8bf-90c3a40bb5b1","resolution":{"observed_at":"2026-05-16T12:40:54.785339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2603.23964","last_updated":"2026-04-13T08:15:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-25T05:56:54Z","title":"From Pixels to Digital Agents: An Empirical Study on the Taxonomy and Technological Trends of Reinforcement Learning Environments","version":2},"reference_index":202,"source":"pdf_text","source_observed_at":"2026-05-15T01:20:03.181903Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2603.23964"},"observation_digest":"sha256:a7595bb39f885a4c1cc005eec8a76f23cb9a14c561d277f2b34b596f41f20eba","observation_id":"015fd05d-9846-488c-9baa-c6ea3f247377","resolution":{"observed_at":"2026-05-15T01:23:27.233413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2605.07353","last_updated":"2026-05-08T07:08:25Z","snapshot_observed_at":"2026-08-11T04:46:32.902221Z","submitted_at":"2026-05-08T07:08:25Z","title":"Confidence-Aware Alignment Makes Reasoning LLMs More Reliable","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:40.020460Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2605.07353"},"observation_digest":"sha256:bee999e9b0b567c7f37d89db59b64af014cad4a9704ac409653ed7d3a8a26e2b","observation_id":"baf5f158-3f8c-4031-9a2e-2ea31bf95a55","resolution":{"observed_at":"2026-05-11T03:55:53.987663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-08-11T16:16:11.008726Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:1cc0eeec1a22189cc33f691f65884dde07480f22e6f93869b310606bb60d737e","observation_id":"16caeec2-af6f-44dd-a223-a6cb3ee161ec","resolution":{"observed_at":"2026-05-12T07:11:24.431684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2606.18910","last_updated":"2026-06-17T10:37:23Z","snapshot_observed_at":"2026-08-02T21:25:42.997753Z","submitted_at":"2026-06-17T10:37:23Z","title":"REVES: REvision and VErification--Augmented Training for Test-Time Scaling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:15.337979Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2606.18910"},"observation_digest":"sha256:ad5e4d6dd8895a739be43afa540af60f7be74e26e9debd6fe7f824dafb8306d2","observation_id":"1240ba79-4253-49fc-98b1-5c45025dfec3","resolution":{"observed_at":"2026-07-04T00:29:15.126478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2506.08989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-10T18:17:33.758346Z","title":"Sws: Self-aware weakness-driven problem synthesis in reinforcement learning for llm reasoning","venue":"cs.LG","work_id":"854e597e-b1de-46bc-95a4-225bb2ccab26","year":2025},"citing_paper":{"arxiv_id":"2607.07779","last_updated":"2026-07-08T17:46:36Z","snapshot_observed_at":"2026-07-12T23:17:59.879344Z","submitted_at":"2026-07-08T17:46:36Z","title":"From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-07-10T18:16:31.176239Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2607.07779"},"observation_digest":"sha256:f295064a5553a73845c33acef7d703251e34b7b290c75d6531e7ac32959149da","observation_id":"9c0575ca-1c65-4e26-a911-8601810c1a2a","resolution":{"observed_at":"2026-07-10T18:17:33.759692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-07-14T15:30:23.485228Z","title":"arXiv , author =:2506.08989v1 , primaryclass =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09803","last_updated":"2026-07-09T17:52:16Z","snapshot_observed_at":"2026-08-06T03:03:16.058770Z","submitted_at":"2026-07-09T17:52:16Z","title":"Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-14T15:30:23.485228Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2607.09803"},"observation_digest":"sha256:53f4fcdadda78c53ce5a41dd678f623c1c1fef19428d9d072e321aa2876b91e5","observation_id":"9211432e-5b7f-4b22-82cc-94924bc16437","resolution":{"observed_at":"2026-07-14T15:30:23.485228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08989","snapshot_observed_at":"2026-08-06T00:08:24.739824Z","title":"N.; and Chen, W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01522","last_updated":"2026-08-02T22:19:01Z","snapshot_observed_at":"2026-08-12T18:57:33.402223Z","submitted_at":"2026-08-02T22:19:01Z","title":"Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T00:08:24.739824Z"},"links":{"cited_paper":"/paper/2506.08989","citing_paper":"/paper/2608.01522"},"observation_digest":"sha256:7d6a6505813d8090f984c470fbd7c7625541eea1f9a58ddb7057115663c8845b","observation_id":"320d73ca-b445-4c57-8b2c-a322c9e2aee3","resolution":{"observed_at":"2026-08-06T00:08:24.739824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08989/citation-record","integrity":"/paper/2506.08989/integrity","json":"/paper/2506.08989/citation-record.json","paper":"/paper/2506.08989"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-07T23:15:28.158449Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-08-07T05:01:24.089154Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models.arXiv preprint arXiv:2502.17387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.089154Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:0fb57a60596d94307461ec18ab25a735291d700ec14a241e6521950851fac7ae","observation_id":"e21e5946-6e2c-4958-aa70-05157d3d6c78","resolution":{"observed_at":"2026-08-07T05:01:24.089154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-13T05:02:02.370925Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-07T05:01:24.092784Z","title":"Weak-to-strong generalization: Eliciting strong capabilities with weak supervision.arXiv preprint arXiv:2312.09390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.092784Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:74ca9b44f16530be8fd1c7aa69d94e7379e980f479531d8ed31f5d84db335c0b","observation_id":"21aae386-2ef6-4aa4-8d78-b48c9020da11","resolution":{"observed_at":"2026-08-07T05:01:24.092784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T05:01:24.096216Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training.arXiv preprint arXiv:2501.17161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.096216Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:8be3aab01839a385b45af3cfd7076ea0e96d0bc44a7c9401c17066cf18c39a0a","observation_id":"f7f6efc6-d15b-4409-b085-79fcfb820213","resolution":{"observed_at":"2026-08-07T05:01:24.096216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T05:01:24.099163Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.099163Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:88a4bcbd5ecffec57083b22494183ee5bc992e59c2bca676c41c48b0b3b3fdc8","observation_id":"795cfb9a-3440-4cc7-b00a-dfeb9e47aef8","resolution":{"observed_at":"2026-08-07T05:01:24.099163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.101834Z","title":"Nearest neighbor pattern classification.IEEE transactions on information theory, 13(1):21–27, 1967","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.101834Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:efcc58581eb270ff0d0482e29760f7e5f695c280c2d520313ed9d498dfa59d8f","observation_id":"444bad16-8172-439e-af77-37911851bead","resolution":{"observed_at":"2026-08-07T05:01:24.101834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T05:01:24.104449Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.104449Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:a0e8138de7e5f74c26008617ba4c0361b98404c9e055a1b412756deb2c2f25c4","observation_id":"8494ff6c-dfad-47cd-b313-b7eec9c5ea07","resolution":{"observed_at":"2026-08-07T05:01:24.104449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.107393Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.107393Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:f0b42a3d491134df11cc97434023f754c4159bba56661f73b5da4b315499d70a","observation_id":"d618a45c-bbd8-44c1-b0e7-8ceaa4afb208","resolution":{"observed_at":"2026-08-07T05:01:24.107393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:01:24.110140Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.110140Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:093b043309700106287897bc0cc2d665b21bd615e40052ae8373e53e44b67987","observation_id":"65d781ef-83f7-4f1c-8f7c-0d316c9fd3c2","resolution":{"observed_at":"2026-08-07T05:01:24.110140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-13T04:00:23.686835Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-07T05:01:24.112886Z","title":"rstar-math: Small llms can master math reasoning with self-evolved deep thinking.arXiv preprint arXiv:2501.04519, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.112886Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:aa715039d5079ede9758c269e6ea95c30b57ba1c19d96b4344fff0d3cbe8a90b","observation_id":"06e02db3-49d4-4303-b2bb-2dae77510a5a","resolution":{"observed_at":"2026-08-07T05:01:24.112886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:01:24.115411Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.115411Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:8199cffba7f05d1f024bf939b88670a604334b2bb8c2862ba1857ab5fcdf5a51","observation_id":"b6a6c548-6f5f-46b1-9fa2-e82483501392","resolution":{"observed_at":"2026-08-07T05:01:24.115411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.117978Z","title":"Olympiad- bench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.117978Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:421b0be88afdb2d4e8f590118dea4a3d2b842bd9487baaa41d5d722c070cf0cd","observation_id":"d58dc3c4-d2cf-4252-a6cd-fa0e7567d73e","resolution":{"observed_at":"2026-08-07T05:01:24.117978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.120427Z","title":"Skyworkopenreasonerseries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.120427Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:2c87e492512dc4869ce96518a6b698c1b4d70f29c25916b8cde9f8bcbacb2928","observation_id":"9d429c5a-2a21-4c17-9e9d-333aca6d0183","resolution":{"observed_at":"2026-08-07T05:01:24.120427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.122804Z","title":"Measuring mathematical problem solving with the math dataset.Sort, 2(4): 0–6, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.122804Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:47cfc9f289770b143ecd85fc28dce69ff309c6a3d5c7c3e67244b1514603d6f8","observation_id":"acdea8a8-df57-4221-90d7-adb65cde3e04","resolution":{"observed_at":"2026-08-07T05:01:24.122804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T05:01:24.125078Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.125078Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:5ad04036cc5a046710f012651e1383aa0504a650945426cc3d224dd1220cb65e","observation_id":"5fdc6bfa-d305-422f-9113-6ae52e74720b","resolution":{"observed_at":"2026-08-07T05:01:24.125078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02333","last_updated":"2024-05-08T01:48:46Z","snapshot_observed_at":"2026-08-13T04:03:43.659692Z","submitted_at":"2024-03-04T18:58:30Z","title":"Key-Point-Driven Data Synthesis with its Enhancement on Mathematical Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02333","snapshot_observed_at":"2026-08-07T05:01:24.127813Z","title":"Key-point-driven data synthesis with its enhancement on mathematical reasoning.arXiv preprint arXiv:2403.02333, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.127813Z"},"links":{"cited_paper":"/paper/2403.02333","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:cc035816773f104b9d1692f4850ecd4c03340f08eda03bfd1ae9e3857ae34911","observation_id":"408a24fd-cfcc-4564-b8ff-ff9c928c58d3","resolution":{"observed_at":"2026-08-07T05:01:24.127813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T05:01:24.130388Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.130388Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:611fd1f847a5a8467b6d75a1c4135ce1be1cc7b31b418a2ce6ae9c343c300dd2","observation_id":"81d44e76-1f7a-41b7-a26f-723b456eaa4f","resolution":{"observed_at":"2026-08-07T05:01:24.130388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.132956Z","title":"Knowledge- augmented reasoning distillation for small language models in knowledge-intensive tasks.Advances in Neural Information Processing Systems, 36:48573–48602, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.132956Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:5a19163dbc127ef84a831e50cc9192dde6fe5686a486d5c6b36d9dc47a174cf7","observation_id":"9aa4b2e8-32b4-4c68-bc0e-e7d79fd00ed8","resolution":{"observed_at":"2026-08-07T05:01:24.132956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.135196Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.135196Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:0cc3470385175a66c35eaded724b99602790b7d60794a2882fbeb4b39e90e361","observation_id":"dffebfb5-adc4-4029-9d9b-9559ba82485f","resolution":{"observed_at":"2026-08-07T05:01:24.135196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.137465Z","title":"Solving quantitative reasoning problems with language models.Advances in Neural Information Processing Systems, 35: 3843–3857, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.137465Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:70ef603a0deb0111fe4ccb8fa7875dac3db2edda1d45604cf4c5e79b1a8228f5","observation_id":"f6e8813c-4150-4f42-b6e7-46e2507e6ec1","resolution":{"observed_at":"2026-08-07T05:01:24.137465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04706","last_updated":"2024-03-07T18:00:40Z","snapshot_observed_at":"2026-08-13T00:59:53.557863Z","submitted_at":"2024-03-07T18:00:40Z","title":"Common 7B Language Models Already Possess Strong Math Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04706","snapshot_observed_at":"2026-08-07T05:01:24.139853Z","title":"Common 7b language models already possess strong math capabilities.arXiv preprint arXiv:2403.04706, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.139853Z"},"links":{"cited_paper":"/paper/2403.04706","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:d660c27fee25101a4760db72f6d7780e6d8e40e78950dbe0b54e771b190ecc40","observation_id":"f8f00e26-8ce6-46d5-8511-c212abc361c4","resolution":{"observed_at":"2026-08-07T05:01:24.139853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.142570Z","title":"From generation to judgment: Opportunities and challenges of llm-as-a-judge.arXiv preprint arXiv:2411.16594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.142570Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:502d5d3707cb775740fadf901e3197765d6cf11c3a06007c2313d945a36ee99d","observation_id":"f00847c0-fec3-4aee-bc29-da9ab492b095","resolution":{"observed_at":"2026-08-07T05:01:24.142570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-12T12:48:14.689935Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T05:01:24.145061Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.145061Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:642d089f29d08b9d67ba5327915841117d60d9e002488b1f254b524b23fbd66c","observation_id":"67b2ffa4-f2eb-4445-bf66-67a400742f9d","resolution":{"observed_at":"2026-08-07T05:01:24.145061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02678","last_updated":"2025-06-14T17:11:38Z","snapshot_observed_at":"2026-08-10T17:20:05.026142Z","submitted_at":"2025-06-03T09:23:41Z","title":"TL;DR: Too Long, Do Re-weighting for Efficient LLM Reasoning Compression","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02678","snapshot_observed_at":"2026-08-07T05:01:24.147834Z","title":"Tl; dr: Too long, do re-weighting for effcient llm reasoning compression.arXiv preprint arXiv:2506.02678, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.147834Z"},"links":{"cited_paper":"/paper/2506.02678","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:233d148782e13f8bd29aeae5ec115eb91a7bd5375e824673e996e831377078a5","observation_id":"2c93907a-1052-42cc-a055-453eef601138","resolution":{"observed_at":"2026-08-07T05:01:24.147834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-07T05:01:24.150655Z","title":"From system 1 to system 2: A survey of reasoning large language models.arXiv preprint arXiv:2502.17419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.150655Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:cd2924193a70c8d31172134052f5163c054a0b9897dd50782b6431edc59a91a4","observation_id":"0527b2e1-f295-4287-a70d-9bbb64f064f3","resolution":{"observed_at":"2026-08-07T05:01:24.150655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16694","last_updated":"2024-06-24T14:58:11Z","snapshot_observed_at":"2026-08-12T23:36:02.735380Z","submitted_at":"2024-06-24T14:58:11Z","title":"Task Oriented In-Domain Data Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16694","snapshot_observed_at":"2026-08-07T05:01:24.153512Z","title":"Task oriented in-domain data augmentation.arXiv preprint arXiv:2406.16694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.153512Z"},"links":{"cited_paper":"/paper/2406.16694","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:bda8fbeb0b24caba34a159ee9143a9d58b81e617b7c5e896f2e507a3182d9ddd","observation_id":"0e47cd1a-4d78-45bc-ada1-90e2f1782f55","resolution":{"observed_at":"2026-08-07T05:01:24.153512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.156285Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.156285Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:4cd19bd16fa8f91056985dd8d5759d230a0440612e63c06cd882c22b5546beae","observation_id":"c0173a58-a462-435d-ab26-f430656a5616","resolution":{"observed_at":"2026-08-07T05:01:24.156285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.159002Z","title":"Augmenting math word problems via iterative question composing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.159002Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:ee8834d603523aaeb1c682c1f2304a4ef165ce9ed4cca131b4acfb29d6758f8f","observation_id":"0c1205cd-def1-4f25-bf6d-668cc55db813","resolution":{"observed_at":"2026-08-07T05:01:24.159002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-12T02:21:51.598634Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T05:01:24.161345Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.161345Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:4bcd2bbd71ad62f998cc1972066c5a992f2d286ea7f2f6d94d1491ce70bf0cfe","observation_id":"5b1eb7ed-159f-4a59-980c-567cb2b38c6b","resolution":{"observed_at":"2026-08-07T05:01:24.161345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15587","last_updated":"2025-08-24T14:19:05Z","snapshot_observed_at":"2026-08-12T16:58:10.088790Z","submitted_at":"2025-01-26T16:26:38Z","title":"SCP-116K: A High-Quality Problem-Solution Dataset and a Generalized Pipeline for Automated Extraction in the Higher Education Science Domain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15587","snapshot_observed_at":"2026-08-07T05:01:24.164213Z","title":"Scp- 116k: A high-quality problem-solution dataset and a generalized pipeline for automated extraction in the higher education science domain, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.164213Z"},"links":{"cited_paper":"/paper/2501.15587","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:bf8420f42b00d3b39e1e72edb671e20392e33cd8e1a7e5acefad81e05f0c9e4e","observation_id":"36f27c6a-6278-4eaf-b813-a876df3e527b","resolution":{"observed_at":"2026-08-07T05:01:24.164213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-07T05:01:24.166865Z","title":"Wizardmath: Empowering mathematical reasoning for large language models via reinforced evol-instruct.arXiv preprint arXiv:2308.09583, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.166865Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:57a137ee00abb62cd2bbcc761fd62071a9e8809eba1aea9cf3421d1fde31f53e","observation_id":"426ff685-7541-4cb4-a2f6-2a7abf44b8c2","resolution":{"observed_at":"2026-08-07T05:01:24.166865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.169433Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.169433Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:476fd4a078e64e0ca0ad0fa7cd10c806f74b9b1ed1d8fe129d523b36b77b9711","observation_id":"0e9c5958-01a1-44c0-8ace-e662bbc76d89","resolution":{"observed_at":"2026-08-07T05:01:24.169433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-13T04:40:53.870336Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-07T05:01:24.171772Z","title":"Reft: Reasoning with reinforced fine-tuning.arXiv preprint arXiv:2401.08967, 3, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.171772Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:2895857804c4c7f53f4d65d13ebd2a68da961541e2f823ab524a5bf09cca2ddf","observation_id":"b1ee18de-6c4a-4f6f-8ec9-ad19fbc7fa63","resolution":{"observed_at":"2026-08-07T05:01:24.171772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.174644Z","title":"American mathematics competitions (AMC 10/12)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.174644Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:b197a77a9ae07c64130a30264f65d47c2f2930a1b718332cab94d8ba4e964a1c","observation_id":"20c33ad2-872d-43ac-8203-ccf0d3296030","resolution":{"observed_at":"2026-08-07T05:01:24.174644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.176910Z","title":"American invitational mathematics examination (AIME)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.176910Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:fb36db4e38fa1f9f4391cd61a680f370813d4c0ff07ee775a354566b321660e8","observation_id":"f3ea30b0-2db3-41fb-b297-c75c47c18ae7","resolution":{"observed_at":"2026-08-07T05:01:24.176910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:01:24.181910Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.181910Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:790b797dbb207e37fa5dc6bd3b175df25f0434608f2c9e923a507f7e3ff2f9b4","observation_id":"9e2c2ddc-9a31-4f0a-bdc1-83ad9eb5649e","resolution":{"observed_at":"2026-08-07T05:01:24.181910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11306","last_updated":"2025-02-16T23:05:36Z","snapshot_observed_at":"2026-08-07T18:14:09.976845Z","submitted_at":"2025-02-16T23:05:36Z","title":"Smoothing Out Hallucinations: Mitigating LLM Hallucination with Smoothed Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11306","snapshot_observed_at":"2026-08-07T05:01:24.184746Z","title":"Smoothing out hallucinations: Mitigating llm hallucination with smoothed knowledge distillation.arXiv preprint arXiv:2502.11306, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.184746Z"},"links":{"cited_paper":"/paper/2502.11306","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:0350b7ba5942fefcfc0b993c2ab4c63f0874e127493299785c8fc518d147881e","observation_id":"eb1e8ecc-1bb2-448b-9ec6-5a8c2ea6156b","resolution":{"observed_at":"2026-08-07T05:01:24.184746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.187499Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730– 27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.187499Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:6e0a77a6d17ea24a31aef7b45f00c9400ff416b2aab76510b2145566fafcee17","observation_id":"3e828667-bcf3-48a7-ad23-a9bd85c9dcfd","resolution":{"observed_at":"2026-08-07T05:01:24.187499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16212","last_updated":"2025-06-16T05:58:00Z","snapshot_observed_at":"2026-08-12T13:19:10.332127Z","submitted_at":"2025-03-20T15:00:41Z","title":"MathFusion: Enhancing Mathematical Problem-solving of LLM through Instruction Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16212","snapshot_observed_at":"2026-08-07T05:01:24.190807Z","title":"Mathfusion: Enhancing mathematic problem-solving of llm through instruction fusion.arXiv preprint arXiv:2503.16212, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.190807Z"},"links":{"cited_paper":"/paper/2503.16212","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:ba7683ec216f5996050b6a9b0888778165df3b1d60f477aff6e89cbd6aff11fe","observation_id":"54129201-6111-4211-851a-87ceeab991c2","resolution":{"observed_at":"2026-08-07T05:01:24.190807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:01:24.193880Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.193880Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:518b97627120ed9ffd28ee9dfdb5fd650acb3d914ac40a0163033328830cb497","observation_id":"544df257-d2cf-496f-a09e-d4f549208a86","resolution":{"observed_at":"2026-08-07T05:01:24.193880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:01:24.196848Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.196848Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:bd1d0e35df215dc1905808cf43b718e7e5462d0c2176a81c8ea050c0421bcc07","observation_id":"8736f22e-dae6-4c9b-8faf-a1c93d6de001","resolution":{"observed_at":"2026-08-07T05:01:24.196848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22230","last_updated":"2025-04-02T13:26:34Z","snapshot_observed_at":"2026-08-07T16:30:48.967400Z","submitted_at":"2025-03-28T08:26:41Z","title":"Exploring Data Scaling Trends and Effects in Reinforcement Learning from Human Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22230","snapshot_observed_at":"2026-08-07T05:01:24.199659Z","title":"Exploring data scaling trends and effects in reinforcement learning from human feedback.arXiv preprint arXiv:2503.22230, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.199659Z"},"links":{"cited_paper":"/paper/2503.22230","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:132c2f072bf1e854c52d42b99eeea1d58f551ed195cdd1446ccab928a98fc22d","observation_id":"24662ffb-c264-4631-af2f-7f3314206f60","resolution":{"observed_at":"2026-08-07T05:01:24.199659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T05:01:24.202855Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv:2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.202855Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:3e2f936e699d8cb99342fd13f836838dc1203dcfdd02bc49ba4ff0075f89ae59","observation_id":"f93e7aa4-8f1a-4dd0-8290-698a6f6bfce2","resolution":{"observed_at":"2026-08-07T05:01:24.202855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-07T16:07:46.182926Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-07T05:01:24.205768Z","title":"Efficient reinforcement finetuning via adaptive curriculum learning.arXiv preprint arXiv:2504.05520, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.205768Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:8e75647011affa82120e0b2e5dff82802027d18b61f5f906119be9c764f180a2","observation_id":"f461f536-92b8-46b9-a689-3f5ae74fa4e8","resolution":{"observed_at":"2026-08-07T05:01:24.205768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.153733Z","title":"Large language models for data annotation and synthesis: A survey","venue":null,"work_id":"d4dd3e19-b3df-4b43-a66b-7bf85e599502","year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.208637Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:f2b6804ff40a361ab2873f4a52289f5acb7a2eb86454b4b1e8ee807dcbb11af7","observation_id":"af7c036a-e277-46cf-bd1e-95ab1ad8d0ef","resolution":{"observed_at":"2026-08-07T05:01:25.156802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.145524Z","title":"Mathscale: Scaling instruction tuning for mathematical reasoning","venue":null,"work_id":"9b90e6c5-89ba-4e77-b49e-b7b11e60dc84","year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.211171Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:973c4e41443ed108efe2516ff917a34c6dc903ce4b105799d20928fb0e21d779","observation_id":"3680da20-6462-4d17-83d2-5ab0e4357c1a","resolution":{"observed_at":"2026-08-07T05:01:25.148509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T05:01:24.213883Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.213883Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:710dca60a7af820c858a34cd2bc67f87530e1caaed49b49524c1419814b98b0f","observation_id":"fbe9324c-2fb3-4fd4-b76d-3acff595b7cf","resolution":{"observed_at":"2026-08-07T05:01:24.213883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.216939Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.216939Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:7abaa5d074738600833a31501b7e125f831fb41694c9348859884bea98afa1fd","observation_id":"7e925c12-d9b7-4362-8e23-4fa43bbb41d0","resolution":{"observed_at":"2026-08-07T05:01:24.216939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.131828Z","title":"Dart-math: Difficulty-aware rejection tuning for mathematical problem-solving.Advances in Neural Information Processing Systems, 37:7821–7846, 2024","venue":null,"work_id":"30ccd00f-37fd-4cfa-a5dc-66d193e3eebe","year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.219750Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:c9334daffa3fef7ad4ff335b026102c7ab69996bd9338a20985dc2cac396c517","observation_id":"2e2b9996-07ec-4440-b989-c866a5647eec","resolution":{"observed_at":"2026-08-07T05:01:25.134887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.124075Z","title":"Openmathinstruct-1: A 1.8 million math instruction tuning dataset.Advances in Neural Information Processing Systems, 37:34737–34774, 2024","venue":null,"work_id":"cce470e3-e131-47d5-9c81-8b1661b6081a","year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.222297Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:7fba0428dca1565ee169570d146a021dd877005852f4c9023c276c6cf33774c2","observation_id":"84ceaeff-0d18-45aa-8f79-707c113c317c","resolution":{"observed_at":"2026-08-07T05:01:25.126951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-11T06:00:55.192366Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-07T05:01:24.224905Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations.arXiv preprint arXiv:2312.08935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.224905Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:5a798e391dabfcc6c38ccb21e8da3403f128ba5ead56a3b494f465200b903812","observation_id":"ead05707-8f16-40f7-9349-cb3cef9a9d93","resolution":{"observed_at":"2026-08-07T05:01:24.224905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06655","last_updated":"2025-02-28T11:58:28Z","snapshot_observed_at":"2026-08-12T22:03:45.062909Z","submitted_at":"2024-11-11T01:42:56Z","title":"Explore the Reasoning Capability of LLMs in the Chess Testbed","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06655","snapshot_observed_at":"2026-08-07T05:01:24.227678Z","title":"Explore the reasoning capability of llms in the chess testbed.arXiv preprint arXiv:2411.06655, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.227678Z"},"links":{"cited_paper":"/paper/2411.06655","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:70d4dbea951ea9c3abea31aec1e291f4a813e646e44e55da83ecec015e67e54b","observation_id":"b30c748d-c604-49f7-9c3c-aa054484011c","resolution":{"observed_at":"2026-08-07T05:01:24.227678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.230830Z","title":"Examining false positives under inference scaling for mathematical reasoning.arXiv preprint arXiv:2502.06217, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.230830Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:b652398d484e426ad8ff2c9b520628f5cf6b03ceece61e8a5d6863ff777a3224","observation_id":"2afe12b7-5507-4f09-9017-3eca11d63e40","resolution":{"observed_at":"2026-08-07T05:01:24.230830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-10T16:59:28.676649Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T05:01:24.233618Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond.arXiv preprint arXiv:2503.10460, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.233618Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:15f053d9aa7096f6e07675ccb143eeeb41ce9ac37689d3a269a947c902e440a1","observation_id":"bf457c15-fa3a-4d33-a7ad-bcdc482e83be","resolution":{"observed_at":"2026-08-07T05:01:24.233618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.236534Z","title":"Fine-grained human feedback gives better rewards for language model training.Advances in Neural Information Processing Systems, 36:59008–59033, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.236534Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:cc6a516d36678fd6c1650952f47461ad8ef1f78ef88b412e3b1afa85feef28ab","observation_id":"3792c869-4ccb-4a8d-b2fb-37e61dfa4142","resolution":{"observed_at":"2026-08-07T05:01:24.236534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T05:01:24.239657Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.239657Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:81f3d61ab3f9151d09079a1780288210f9839e783dd1d011b15c1e144b86a734","observation_id":"962e3e5d-9e77-4b1e-aa22-9c407beb8a47","resolution":{"observed_at":"2026-08-07T05:01:24.239657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-07T05:01:24.242658Z","title":"Wizardlm: Empowering large language models to follow complex instructions.arXiv preprint arXiv:2304.12244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.242658Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:18be1c8ede07cd78bdf97b02a53a32c729576c3a082369937c5db11755732e85","observation_id":"be76fbae-93bd-43b9-9954-a0c0b08d0d4f","resolution":{"observed_at":"2026-08-07T05:01:24.242658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T05:01:24.245535Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.245535Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:2ab9d1c56dac86a13166067569c2567e3ddd48d97d915e2f96374d74cf5510cd","observation_id":"76e5be5d-b6b1-4df6-9000-713d118aac47","resolution":{"observed_at":"2026-08-07T05:01:24.245535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T05:01:24.248156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.248156Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:8caac1f1c8cc5049322261adc1609f5ba161df043ab8d3090f0e3852f28b255c","observation_id":"7cdadef9-18d5-456d-ab77-de1091d4c497","resolution":{"observed_at":"2026-08-07T05:01:24.248156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T05:01:24.250842Z","title":"Limo: Less is more for reasoning.arXiv preprint arXiv:2502.03387, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.250842Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:014c98d55f15316a84f49e8e8813e3124a8dfd5bf4e920e02322beff3df51eb7","observation_id":"49f89318-4f59-4b71-b1cb-89104f99129c","resolution":{"observed_at":"2026-08-07T05:01:24.250842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-07T05:01:24.253700Z","title":"Demystifying long chain- of-thought reasoning in llms.arXiv preprint arXiv:2502.03373, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.253700Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:a7fd6ec76c1b093468fd4a0c5f3b49761c30db9fc1c50495a7ca2e5eccb8d96c","observation_id":"a9f9b1f8-3f34-4f5c-b985-d526825b24e3","resolution":{"observed_at":"2026-08-07T05:01:24.253700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03469","last_updated":"2025-05-21T06:17:56Z","snapshot_observed_at":"2026-08-07T15:49:35.004987Z","submitted_at":"2025-05-06T12:18:11Z","title":"Long-Short Chain-of-Thought Mixture Supervised Fine-Tuning Eliciting Efficient Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03469","snapshot_observed_at":"2026-08-07T05:01:24.256779Z","title":"Long-short chain-of- thought mixture supervised fine-tuning eliciting efficient reasoning in large language models.arXiv preprint arXiv:2505.03469, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.256779Z"},"links":{"cited_paper":"/paper/2505.03469","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:9f9424e81f38301c9c3ccab68e3197c1016a6c1ef6250a707e5ed7f77f5538f5","observation_id":"d1649c7b-2163-4771-b4ba-dd88ccf752bb","resolution":{"observed_at":"2026-08-07T05:01:24.256779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-07T05:01:24.260331Z","title":"Metamath: Bootstrap your own mathematical questions for large language models.arXiv preprint arXiv:2309.12284, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.260331Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:0b669ef41cef55ab309db8d7c2f5d4f4b5b77b2c8982edcb9f61e7bc7e75a87b","observation_id":"decbd585-0da8-4383-9b40-8653b184b4ee","resolution":{"observed_at":"2026-08-07T05:01:24.260331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:01:24.263254Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.263254Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:d0acc5cf790c2f936d614f02ebc2ffa3fe0af00f788c92b746d8cfcc72c43100","observation_id":"42b9d5fd-007a-4d0f-8532-9d229f7347a2","resolution":{"observed_at":"2026-08-07T05:01:24.263254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11110","last_updated":"2025-09-04T14:01:21Z","snapshot_observed_at":"2026-08-12T11:40:40.242039Z","submitted_at":"2025-01-19T16:53:26Z","title":"Chain-of-Reasoning: Towards Unified Mathematical Reasoning in Large Language Models via a Multi-Paradigm Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11110","snapshot_observed_at":"2026-08-07T05:01:24.266890Z","title":"Chain-of-reasoning: Towards unified mathematical reasoning in large language models via a multi-paradigm perspective.arXiv preprint arXiv:2501.11110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.266890Z"},"links":{"cited_paper":"/paper/2501.11110","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:0625d2a49d2f76b1c3bc8902f46d801328477de5ba43de604d65cb4d7464c98b","observation_id":"357d701a-568f-4f66-9ec6-53b779eeae76","resolution":{"observed_at":"2026-08-07T05:01:24.266890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T05:01:24.270146Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.270146Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:f2d3376c8b9ea9dc6ddedf3afb19c6cb4a5183425ee86c173b9e133cace22375","observation_id":"f9d31dd3-77a0-4581-918f-ffdecd649ba1","resolution":{"observed_at":"2026-08-07T05:01:24.270146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T05:01:24.272905Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.272905Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:541151f9c96236a48da9dc959a8f0511d64e80cf4e50b63e85ffa8a422ac6d83","observation_id":"89a8ed69-2f13-41d2-b7c5-05d6d8c1b80b","resolution":{"observed_at":"2026-08-07T05:01:24.272905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T05:01:24.275765Z","title":"Simplerl- zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.275765Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:575cbd87b6716f7bdc4560b5be0c34c80fbae9325166f3af30b851343c5552ae","observation_id":"f3a71132-7d0a-4ed9-8b16-0e1a34f67b49","resolution":{"observed_at":"2026-08-07T05:01:24.275765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.278944Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search.Advances in Neural Information Processing Systems, 37:64735–64772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.278944Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:a194745242f7b7c79b36c1951d90283ae37e1b580bfadba6f5a97040b4bddd63","observation_id":"0c633bf1-ae61-4c18-a6d4-4047f6ea3b29","resolution":{"observed_at":"2026-08-07T05:01:24.278944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.105922Z","title":"Balancing speciality and versatility: a coarse to fine framework for supervised fine-tuning large language model","venue":null,"work_id":"7d7b66e9-ceb3-48b2-adab-5e7d0d896531","year":2024},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.281621Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:2e43f47d8fbd1002f8931b03cd2bd934b9dd36996b05ded0c3fc8dfc604eefc2","observation_id":"228a7f3b-d51f-4453-892b-52afc8a2d0bb","resolution":{"observed_at":"2026-08-07T05:01:25.108731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03746","last_updated":"2025-03-05T18:58:44Z","snapshot_observed_at":"2026-08-07T17:26:48.410599Z","submitted_at":"2025-03-05T18:58:44Z","title":"Process-based Self-Rewarding Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03746","snapshot_observed_at":"2026-08-07T05:01:24.284330Z","title":"Process-based self-rewarding language models.arXiv preprint arXiv:2503.03746, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.284330Z"},"links":{"cited_paper":"/paper/2503.03746","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:26201f368a981a0353d62d5481f460c36ce6e945ba3ebdccc03e7217673a60a5","observation_id":"b8e0183b-dd8c-426c-b887-fb5a31b60961","resolution":{"observed_at":"2026-08-07T05:01:24.284330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12474","last_updated":"2024-02-24T15:44:21Z","snapshot_observed_at":"2026-08-08T08:58:54.609425Z","submitted_at":"2023-05-21T14:39:28Z","title":"Evaluating the Performance of Large Language Models on GAOKAO Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12474","snapshot_observed_at":"2026-08-07T05:01:24.287403Z","title":"Evaluating the performance of large language models on gaokao benchmark.arXiv preprint arXiv:2305.12474, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.287403Z"},"links":{"cited_paper":"/paper/2305.12474","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:e7235e0b6783704709998b4c402306c26fe9292736cf30885912658b28b4eb71","observation_id":"9aad07c4-6676-4390-ac88-39428790589a","resolution":{"observed_at":"2026-08-07T05:01:24.287403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19633","last_updated":"2025-03-25T13:19:46Z","snapshot_observed_at":"2026-08-12T22:48:57.315672Z","submitted_at":"2025-03-25T13:19:46Z","title":"1.4 Million Open-Source Distilled Reasoning Dataset to Empower Large Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19633","snapshot_observed_at":"2026-08-07T05:01:24.290580Z","title":"1.4 million open-source distilled reasoning dataset to empower large language model training.arXiv preprint arXiv:2503.19633, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.290580Z"},"links":{"cited_paper":"/paper/2503.19633","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:49bea6f8feb0ec070bb1bb35c73f65a8e79260a8846d45e4fe625314cd904fa0","observation_id":"3777fc28-c445-4af4-a4f2-55d684f645d5","resolution":{"observed_at":"2026-08-07T05:01:24.290580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.293756Z","title":"Promptcot: Synthesizing olympiad-level problems for mathematical reasoning in large language models.arXiv preprint arXiv:2503.02324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.293756Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:c5affaa047c97fe85c534d393d861cbac0524eaa13df5176e2f0222965940f84","observation_id":"593556dd-f49d-456d-9bcf-f6e075cae8d2","resolution":{"observed_at":"2026-08-07T05:01:24.293756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T05:01:24.296727Z","title":"Fine-tuning language models from human preferences.arXiv preprint arXiv:1909.08593, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.296727Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:a9f814114298a8b6eb764e926e5327ce07d02ae7ca1e71ad64544cedc6bdff28","observation_id":"2b7f6c82-2274-4773-bfb0-c0f83c69af82","resolution":{"observed_at":"2026-08-07T05:01:24.296727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T05:01:24.299735Z","title":"Ttrl: Test-time reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.299735Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:d8c5c624359f0ba98342123be40d87043758f84ec4288fe794f15884b4f0e41e","observation_id":"608a7665-1ac5-4b48-9ee8-a877948827b9","resolution":{"observed_at":"2026-08-07T05:01:24.299735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.097851Z","title":"Let’s think step by step and output the final answer within “∖boxed{}","venue":null,"work_id":"f3a3e08e-1a0a-401f-937e-569471cd88c1","year":1905},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.303152Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:24bcbd8f5bb2597b6247437afac5e69ca2ebc92aba950733bb4df2902eeac19a","observation_id":"85ac589d-1f86-4088-b7ac-c1ef40899a16","resolution":{"observed_at":"2026-08-07T05:01:25.100791Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.090419Z","title":null,"venue":null,"work_id":"bc867a16-6592-4c5e-97a2-91b0ec16595d","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.307054Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:f2cb60c4d995c247259918f56fab2ec91f29d97a7a41cdadc8c306a98a39cc50","observation_id":"4acc41aa-0735-45ab-9090-ced5baf37279","resolution":{"observed_at":"2026-08-07T05:01:25.092909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.083240Z","title":null,"venue":null,"work_id":"79552723-2e0f-4cd8-80e8-ce78849b54d3","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.310240Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:3ed87c55c1494a17c3cc01c23534e445b234616d92a7a99cbeb32e5590117775","observation_id":"3893a523-8b05-4b9e-b204-8ab6420d5ab1","resolution":{"observed_at":"2026-08-07T05:01:25.085821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.075851Z","title":null,"venue":null,"work_id":"9c77db56-d86b-4975-8819-14748b27761d","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.313777Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:2c5efa0a79d87a4f87add54577be2c92a089fbc8fef57a8f134eb6894f7c7f1f","observation_id":"906fa85b-88d0-4375-baeb-cf59e85ddbc5","resolution":{"observed_at":"2026-08-07T05:01:25.078266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.068757Z","title":null,"venue":null,"work_id":"5a0e0373-c40c-4745-9cba-fd97cd1d38bd","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.317134Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:af34c3ea797af6ed13312dd5222fcfaed14eab2b35d5625931ae18dc4eb78036","observation_id":"765d8801-9e27-4e21-a3eb-90cc2a0225de","resolution":{"observed_at":"2026-08-07T05:01:25.071266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.061177Z","title":null,"venue":null,"work_id":"b18ffedd-30c1-40a1-b3d9-6a9910bd92b9","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.319986Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:8b47076c5727bbaa4c38ab85765fc2003d6a03da6b9aee8c68dfe048b53e1cab","observation_id":"ac286313-68a0-422e-8629-f9813c2d82fc","resolution":{"observed_at":"2026-08-07T05:01:25.064054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.052966Z","title":"### Output Format : - First , provide your brief outline and planning for the question design","venue":null,"work_id":"1c08922e-e21a-4835-893f-94b319548db9","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.322640Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:28cf3ffef88ab0f1ad568abc557fbc839f2da0c9ef9f3c710da8c29591104117","observation_id":"488ecaf7-548b-4632-aa20-a3822232e1b7","resolution":{"observed_at":"2026-08-07T05:01:25.056425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.045453Z","title":null,"venue":null,"work_id":"8015ed75-9950-4135-a8bd-3f0987754d05","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.325562Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:f7f537aea3d8d6723346e1a26b279a696fc95d31477d2d07b900c5aa9db72f5e","observation_id":"7d10985f-22f1-41e3-89f4-74447f4600e0","resolution":{"observed_at":"2026-08-07T05:01:25.048156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.037350Z","title":null,"venue":null,"work_id":"654df15a-2416-4ddf-873a-5336187beca2","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.328306Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:d433227a183c27d83d9a768c828d92d6e7c410295fb4c880d3d0c4016afdda56","observation_id":"cc6fcc66-609d-4c2d-b844-5f0cc2574456","resolution":{"observed_at":"2026-08-07T05:01:25.039882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.030072Z","title":null,"venue":null,"work_id":"b3c59c43-ba1b-4362-af0e-f581e5e94907","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.331186Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:bc6079eb39c6e4fdc5ef5bec02bbab89d906244c75d866345bbc59e2262068c3","observation_id":"9f239392-f56b-4ff8-8874-8024e6abbd73","resolution":{"observed_at":"2026-08-07T05:01:25.032590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.022373Z","title":null,"venue":null,"work_id":"401d9699-962c-4984-ade1-cb0745f43792","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.334078Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:1d6569fdd0852565450a8ae13d5fc47c62df60d12d87f49907673a9d80f8e01d","observation_id":"ab9efd30-3f79-4d89-b83c-a3af5ccf71fd","resolution":{"observed_at":"2026-08-07T05:01:25.025142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.013979Z","title":null,"venue":null,"work_id":"bcb0ab1e-d62c-4693-8c74-02f0160f6a61","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.336829Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:aea3e5f282705f9f381debbd6c542b590845924aff20a3feb24dd4a1e9bf3d93","observation_id":"9b151e98-c755-4475-86d1-5df25b4d329a","resolution":{"observed_at":"2026-08-07T05:01:25.016741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.005379Z","title":null,"venue":null,"work_id":"d2446d1b-5dd4-4615-a897-c55cda33bdd2","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.339956Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:725fb83a2667a2ef53dccec842cf9a1554474d6507a05f617d6f07e5d59a6448","observation_id":"1211b350-b2b1-4cc7-9083-ef9bcb61a25e","resolution":{"observed_at":"2026-08-07T05:01:25.008134Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.996807Z","title":null,"venue":null,"work_id":"981773b8-7382-4717-aed7-1200bbdfd6b0","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.344131Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:9b461b60cc0ef05975334d6c01fc5628b6d3c831f4cae22871cea9a6aa1b473e","observation_id":"a7b43e2e-2ffb-437d-9b50-cef7c5b7c573","resolution":{"observed_at":"2026-08-07T05:01:24.999815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.988866Z","title":null,"venue":null,"work_id":"888faa44-6a42-444d-b8eb-5e3dceffa852","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.346982Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:9c05a8e1ca28de0826601374221d281dc9d3cd3ff6b629cc61f646b067280079","observation_id":"72a69c35-1e4e-4365-87e9-1ef6359e27c4","resolution":{"observed_at":"2026-08-07T05:01:24.991456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.981095Z","title":null,"venue":null,"work_id":"bb69795b-f097-4bea-b7d9-04de1dcab271","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.349775Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:7181acf708af6e40f701fc904cda225940397ef531142b3823ef5e5ccc65f78f","observation_id":"db2a18fe-e500-49f5-a2c1-614161821f13","resolution":{"observed_at":"2026-08-07T05:01:24.983773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.970937Z","title":null,"venue":null,"work_id":"7c7c5211-1bd7-40c1-8c73-a4eed77449d1","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.353008Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:985d2078fd089cdccd53387adf3ebda5d574b4a2ff72388cc9aa2eeca6611f48","observation_id":"864def1b-ffd6-49e7-ab28-d8d31f5552df","resolution":{"observed_at":"2026-08-07T05:01:24.974829Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:25.168313Z","title":null,"venue":null,"work_id":"ec4522e5-938d-4e0e-99c3-a8416cc4cd63","year":null},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.179317Z"},"links":{"citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:60e4d1de8fb3aacdb4e744945a5992389ce17c7ce21eda18dc090867bed74272","observation_id":"944059f0-1116-4255-9878-3e7afa29d930","resolution":{"observed_at":"2026-08-07T05:01:25.170896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning"},"reference_resolution":{"displayed":93,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":86,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":93},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 93 of 93 outbound references and 13 inbound Pith citation observations for arXiv:2506.08989."}