{"as_of":"2026-08-18T07:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bb65090903301becc6eab7f70d52ad60d278a5605f5d24892f58874a5cc85a2","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:19:46.727588Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T12:54:32.886708Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T19:45:00.969348Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"cited_work":{"arxiv_id":"2508.13023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13023","snapshot_observed_at":"2026-06-30T19:45:00.969348Z","title":"G{2} rpo-a: Guided group relative policy optimization with adaptive guidance","venue":null,"work_id":"1d3786a1-7666-41d7-bf86-70e4bf66bbb4","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2508.13023","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:668047d1937b3ba7c11681b65e7f542268bb409381c343e1bccca8c71f89358d","observation_id":"c77f7630-e7d6-44fb-b63a-597701da933d","resolution":{"observed_at":"2026-05-18T00:05:31.574588Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"cited_work":{"arxiv_id":"2508.13023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13023","snapshot_observed_at":"2026-06-30T19:45:00.969348Z","title":"G{2} rpo-a: Guided group relative policy optimization with adaptive guidance","venue":null,"work_id":"1d3786a1-7666-41d7-bf86-70e4bf66bbb4","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2508.13023","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:180b73ab79f8948399a5e93050bca25f4f5cf3c5b346eb668743bc5f6eca1d87","observation_id":"7199d10d-8201-4edd-bc17-a5419835fcc6","resolution":{"observed_at":"2026-05-10T23:15:48.905173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"cited_work":{"arxiv_id":"2508.13023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13023","snapshot_observed_at":"2026-06-30T19:45:00.969348Z","title":"G{2} rpo-a: Guided group relative policy optimization with adaptive guidance","venue":null,"work_id":"1d3786a1-7666-41d7-bf86-70e4bf66bbb4","year":2025},"citing_paper":{"arxiv_id":"2605.15980","last_updated":"2026-06-16T09:11:40Z","snapshot_observed_at":"2026-08-13T04:44:34.161405Z","submitted_at":"2026-05-15T14:13:39Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T18:28:06.253200Z"},"links":{"cited_paper":"/paper/2508.13023","citing_paper":"/paper/2605.15980"},"observation_digest":"sha256:ef2e0da055a3517b0c402961a0b7622328a2d292d4bb112ef0e033747aba09bf","observation_id":"965b4760-9fc6-4212-9403-9f045c9e2cf2","resolution":{"observed_at":"2026-05-20T18:28:52.857138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"cited_work":{"arxiv_id":"2508.13023","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13023","snapshot_observed_at":"2026-06-30T19:45:00.969348Z","title":"G{2} rpo-a: Guided group relative policy optimization with adaptive guidance","venue":null,"work_id":"1d3786a1-7666-41d7-bf86-70e4bf66bbb4","year":2025},"citing_paper":{"arxiv_id":"2605.15980","last_updated":"2026-06-16T09:11:40Z","snapshot_observed_at":"2026-08-13T04:44:34.161405Z","submitted_at":"2026-05-15T14:13:39Z","title":"Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T19:37:18.563704Z"},"links":{"cited_paper":"/paper/2508.13023","citing_paper":"/paper/2605.15980"},"observation_digest":"sha256:9fdc0521f29ea74fa0d75b4f11fa73afa2a95cfc5b80f036fd795ff80664c15f","observation_id":"352b23a7-b5db-4e71-9ddd-108c87290dcf","resolution":{"observed_at":"2026-06-30T19:45:00.970934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13023","snapshot_observed_at":"2026-08-01T12:54:32.886708Z","title":"Ggrpo-a: Guided group relative policy optimization with adaptive guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-12T20:21:39.140409Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:32.886708Z"},"links":{"cited_paper":"/paper/2508.13023","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:e1eb65c214ebdd7936c14dcd86eb4fa1120f44792737b684b6f694acd928a2f6","observation_id":"a7c748f7-a37a-483c-9dcc-c030f20fa417","resolution":{"observed_at":"2026-08-01T12:54:32.886708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.13023/citation-record","integrity":"/paper/2508.13023/integrity","json":"/paper/2508.13023/citation-record.json","paper":"/paper/2508.13023"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.505625Z","title":"Online difficulty filtering for reasoning oriented reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.505625Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:dee82412c6a766b5658995c3fe04cf97cd0d54f8cf252e6941f23f59e1fdee27","observation_id":"c75a34cc-36a6-4bca-8bd6-59520750e758","resolution":{"observed_at":"2026-08-15T17:19:46.505625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T17:19:46.511599Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.511599Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:c9b6666507e580b550cdfa5872a3bd68b0ef7cfa2adcd74721c705e9388a4e88","observation_id":"149cde66-37c7-40ba-8ba9-98ba139589a0","resolution":{"observed_at":"2026-08-15T17:19:46.511599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.139881Z","title":"SFT memorizes, RL generalizes: A comparative study of foundation model post-training","venue":null,"work_id":"c98b992b-448f-4e29-82cb-49fe64227450","year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.518887Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:9741edc342382c7eb0ab0cc84c5fd5912d953f4887b6dfb59ababff17c506a01","observation_id":"8a1b8c73-9d9c-4ffa-84f1-a3be7ea22c59","resolution":{"observed_at":"2026-08-15T17:19:48.144803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.125440Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":"525301af-a074-4de2-ad24-ddfb03cf96e1","year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.524548Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:08e74c5650654b4050aa173b9ab95cc5110139c9acb0946162bbff0c9485fdf1","observation_id":"45835a5f-e947-45ab-af7b-d69fe5bd0fdc","resolution":{"observed_at":"2026-08-15T17:19:48.131287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.529591Z","title":"Reinforcement learning for reasoning in small llms: What works and what doesn't, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.529591Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:53c45add16773e79dfb2c40ad054a649afc6d50929424e329bf3402f1ce02ac9","observation_id":"75ccf331-5611-4755-91d6-4b8a524c23c2","resolution":{"observed_at":"2026-08-15T17:19:46.529591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.535537Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.535537Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:e09b7b111139df3e97ca245cf5aa6cef21d29cd053fa42d691f21f1f112e08ec","observation_id":"e188b9d9-5485-4f0e-92a6-4625d284af3b","resolution":{"observed_at":"2026-08-15T17:19:46.535537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.101175Z","title":"rstar-math: Small LLM s can master math reasoning with self-evolved deep thinking","venue":null,"work_id":"3e258607-506b-45f3-aa2a-1063fc9c1c9e","year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.540586Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:6197224b074c61e60d75531706a730b93829a1f1875cf162298998b19c6e4bda","observation_id":"c2bc58f9-b8bc-4227-bb8f-931ed576b5ea","resolution":{"observed_at":"2026-08-15T17:19:48.106451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.087616Z","title":"Deepseek-coder: When the large language model meets programming-the rise of code intelligence","venue":null,"work_id":"c8167cd4-6fec-4f1e-a572-3d753e0b9722","year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.545294Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:ae295a06b9546b11295604cdf1d7c920fae86206be65d219332fcb62450fd962","observation_id":"7a1b0738-3d2c-4cfb-a326-994cb350657b","resolution":{"observed_at":"2026-08-15T17:19:48.091920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:19:46.549537Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.549537Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:92c2e12944a77972fd9a5fee1ecc19c0ae430dd86d2b76ce638eecea4322fbac","observation_id":"a0613843-62b1-4801-8b74-e0ea1ba4c4d2","resolution":{"observed_at":"2026-08-15T17:19:46.549537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.074573Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"33566f61-f24a-4273-8c2c-cec51e16c838","year":2021},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.553777Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:799a5381f68e9c9a4c6e42371f41fe2ee3d122ef5903a97bd3810daa8d442c7b","observation_id":"6e79b2e2-ae76-46b7-972d-c330b1460853","resolution":{"observed_at":"2026-08-15T17:19:48.079391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.059046Z","title":"Efficoder: Enhancing code generation in large language models through efficiency-aware fine-tuning","venue":null,"work_id":"e715e80b-3fff-4213-a7d9-121be2d2e7f4","year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.558402Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:f3aca60987b58290c9c9bc2e7b3dc8a6c5df9d3759d0f9e0ed9f7433d8da9fba","observation_id":"71146fb6-1d70-4372-b783-973735f60fef","resolution":{"observed_at":"2026-08-15T17:19:48.064375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23905","last_updated":"2025-06-27T14:37:02Z","snapshot_observed_at":"2026-08-16T12:45:24.960151Z","submitted_at":"2025-03-31T09:54:55Z","title":"Boosting MLLM Reasoning with Text-Debiased Hint-GRPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23905","snapshot_observed_at":"2026-08-15T17:19:46.562236Z","title":"Boosting mllm reasoning with text-debiased hint-grpo, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.562236Z"},"links":{"cited_paper":"/paper/2503.23905","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:7660d23735dce478dbe7e65697b786d338196c990ddc0b92f1e536e98f72ce90","observation_id":"515f637c-d318-4d4b-881e-95ea3ddf5c92","resolution":{"observed_at":"2026-08-15T17:19:46.562236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.044174Z","title":"Openai o1 system card","venue":null,"work_id":"8e637881-3a6e-42a4-a11f-1a6d3d95417f","year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.566203Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:b4abc58738a8667697317f24faae4e7293de14a99e446dc1d0b9033944a9c63c","observation_id":"6520eb37-07a4-462b-8a0a-59f6bc70fdab","resolution":{"observed_at":"2026-08-15T17:19:48.048924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.030042Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"9ccd8583-d430-4506-814a-8756df59d820","year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.570209Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:992eac1d3c133e4af1e004221079055c495f96d9bb26c4805f5ffc1af7a0b77c","observation_id":"f048cd56-dd51-4081-8bd0-cb5ab0482af2","resolution":{"observed_at":"2026-08-15T17:19:48.034588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00103","last_updated":"2025-06-11T14:56:19Z","snapshot_observed_at":"2026-08-15T19:33:54.251950Z","submitted_at":"2025-05-30T14:34:57Z","title":"Writing-Zero: Bridge the Gap Between Non-verifiable Tasks and Verifiable Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00103","snapshot_observed_at":"2026-08-15T17:19:46.573914Z","title":"Writing-zero: Bridge the gap between non-verifiable tasks and verifiable rewards, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.573914Z"},"links":{"cited_paper":"/paper/2506.00103","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:24296b3580aab99dff02ef4c8ce93c7e4807ec82734e47e1c48a0784d0594520","observation_id":"0c6b147c-abe7-4112-98d1-58c6628e0006","resolution":{"observed_at":"2026-08-15T17:19:46.573914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.577908Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.577908Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:9502fba3b2a40ebd7fc915d6c19ab2f7c8f195bb48603275838f5adca5492e69","observation_id":"fde8c8b0-9c50-4718-8f10-b7d7b5771721","resolution":{"observed_at":"2026-08-15T17:19:46.577908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:48.009963Z","title":"Token-supervised value models for enhancing mathematical reasoning capabilities of large language models","venue":null,"work_id":"e2e01f47-63d5-45e6-826f-d3c1af8c3c0a","year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.581529Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:84d3ae3281901088b94cad72ec50f2f127aee37b421ed0e1848b6b3f2cce52e1","observation_id":"bda7d050-c78a-431a-a6d6-2fd821607e3a","resolution":{"observed_at":"2026-08-15T17:19:48.014470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.585647Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.585647Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:44d959cd15da25947085e83631334b09d523cb8f772157541cbb56ae5f78c97c","observation_id":"d7ac7730-610d-40cf-bb66-88d44aedb63d","resolution":{"observed_at":"2026-08-15T17:19:46.585647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.589861Z","title":"Adaptive group policy optimization: Towards stable training and token-efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.589861Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:b7c4ca93a7e892690c161b1c6e9731cf7bbec42d49e827684d8f50618db6407b","observation_id":"879fe752-d194-424d-92c7-328228aa2cfb","resolution":{"observed_at":"2026-08-15T17:19:46.589861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:47.988888Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions, 2024","venue":null,"work_id":"6a6f0ccf-3125-45fd-908b-a3706d855d44","year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.593437Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:aa10284b4d3d9f55361589fb1c69691736777927592798aef7d5d39e42c4f52f","observation_id":"c516c940-adde-42ac-8535-18ab9e8faf8e","resolution":{"observed_at":"2026-08-15T17:19:47.993545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-18T07:08:35.277799Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-15T17:19:46.597081Z","title":"Torl: Scaling tool-integrated rl","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.597081Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:0738ff51aa9aedc33bc7a5bd890c1c0b0ef08357134b2aab3c227943e03ed80c","observation_id":"243c78a3-5ade-4f3d-b10a-0bff989019c9","resolution":{"observed_at":"2026-08-15T17:19:46.597081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.602068Z","title":"Cppo: Accelerating the training of group relative policy optimization-based reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.602068Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:339da90c74b104bce5207a1c609c7e102a5b77bce540a1b53510ddb8fd9acd10","observation_id":"83670a95-f09e-4169-9018-1c0fe7410c3b","resolution":{"observed_at":"2026-08-15T17:19:46.602068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-15T17:19:46.608105Z","title":"Understanding r1-zero-like training: A critical perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.608105Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:c307e008209e7e15b3cbc42aa91d2beac9d786ba97ba4eea40059ca664ef9e6f","observation_id":"cd9b5000-af6d-42ab-8f6f-1b066d270705","resolution":{"observed_at":"2026-08-15T17:19:46.608105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:47.976109Z","title":"Small language models: Survey, measurements, and insights","venue":null,"work_id":"91bca842-5444-4e36-9151-953dc01e62e1","year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.612906Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:7890472261e52312f85d46f3f514cf7ebc0aed776ee6a03a620ce6be30bde2a1","observation_id":"827b1cfb-9337-42af-b588-a928234e0c02","resolution":{"observed_at":"2026-08-15T17:19:47.980090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:47.963660Z","title":"s1: Simple test-time scaling","venue":null,"work_id":"da6285f3-f765-4573-ba93-b4320ed8abf1","year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.616508Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:47324d10dc32ee2d360b3e4e797547b9eb00fdcb3d05c0c35edd73aca3ef164b","observation_id":"e7fe4ed3-ea77-4cd6-a2b2-09589415a285","resolution":{"observed_at":"2026-08-15T17:19:47.967672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-15T17:19:46.620199Z","title":"s1: Simple test-time scaling, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.620199Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:672e6f6c8e3813a940655f60180d8501a25697596ff862a90235b89f856acd2f","observation_id":"1b26f9eb-f1dd-44bc-b93e-f58c7b7dbc54","resolution":{"observed_at":"2026-08-15T17:19:46.620199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-15T17:19:46.624230Z","title":"Adaptive guidance accelerates reinforcement learning of reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.624230Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:b7c1504ad91513c01c35caa1db8a0e1978623d2bbf1e3f4fad7698f070047db8","observation_id":"daff95ec-0fc9-4ba0-9be5-c2f08db63c37","resolution":{"observed_at":"2026-08-15T17:19:46.624230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20011","last_updated":"2024-10-25T23:52:28Z","snapshot_observed_at":"2026-08-16T13:05:49.624956Z","submitted_at":"2024-10-25T23:52:28Z","title":"A Survey of Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20011","snapshot_observed_at":"2026-08-15T17:19:46.628011Z","title":"Ahmed, Nedim Lipka, Ruiyi Zhang, Xiang Chen, Tong Yu, Sungchul Kim, Hanieh Deilamsalehy, Namyong Park, Mike Rimer, Zhehao Zhang, Huanrui Yang, Ryan A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.628011Z"},"links":{"cited_paper":"/paper/2410.20011","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:0c9cba51a4b78f169df9f934a36cb57609d33542f8c1e252504f34001741f8e2","observation_id":"cb7534cf-b858-42f5-90f0-b47a108a5dc3","resolution":{"observed_at":"2026-08-15T17:19:46.628011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.632022Z","title":"Curriculum reinforcement learning from easy to hard tasks improves llm reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.632022Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:78544fc190cce3ff0d5836c068cfc8927ca6e3873fa4d2b9d0bff8db94a3e84e","observation_id":"96295283-9d95-404b-b7c7-15f5b92c4957","resolution":{"observed_at":"2026-08-15T17:19:46.632022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.635814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.635814Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:cff280f47f9616ad3776f4fc39926c3253ad831923169984b8b3e93fc506d0c7","observation_id":"e3cd0096-4b07-4adb-9b1f-a4335e08728d","resolution":{"observed_at":"2026-08-15T17:19:46.635814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.640606Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.640606Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:ef9b59d6e9bc008e47f856132b222a67a54fc7e0ef49c61500aad9301057b1d8","observation_id":"d861c179-3a45-4ee4-b0c5-ebe061af31bc","resolution":{"observed_at":"2026-08-15T17:19:46.640606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T17:19:46.644451Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.644451Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:a72c6d45771f6d2600d6d613f62e6bb8b7baf6c41d7ab8232f93777e22baadef","observation_id":"43617af5-1158-4521-af8e-171a75d3782e","resolution":{"observed_at":"2026-08-15T17:19:46.644451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T17:19:46.648332Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.648332Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:2a37aabc9a3cc614389e658fcfa310dee6dd2ee033d6a085747f18231092c665","observation_id":"8f984c72-a38c-4164-b1ed-eeee9ba464cd","resolution":{"observed_at":"2026-08-15T17:19:46.648332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-16T12:43:12.912218Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-15T17:19:46.652856Z","title":"Efficient reinforcement finetuning via adaptive curriculum learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.652856Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:9e3cabbef0a77167f9f6c2fcec7b5525cfd8a63c1c3c65e8dc7f3e54fa904212","observation_id":"fdfee086-c493-47ad-a94c-e0a00f804dfe","resolution":{"observed_at":"2026-08-15T17:19:46.652856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.656934Z","title":"Code generation with small language models: A deep evaluation on codeforces, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.656934Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:326c04083187e66b793e2bb6a148df93324215618d79bf46c5015663871acbe6","observation_id":"953ad0cb-4862-4553-a3fd-c6e493995ea5","resolution":{"observed_at":"2026-08-15T17:19:46.656934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.660663Z","title":"Qwq: Reflect deeply on the boundaries of the unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.660663Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:c404fbeffdd0f69fdcf42b33bff4380d9555d56a9b9e21ff08b56435b9292101","observation_id":"4733867b-9ed2-46e3-a54b-40009ccd5379","resolution":{"observed_at":"2026-08-15T17:19:46.660663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-16T13:09:59.425817Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-15T17:19:46.664569Z","title":"Ni, Linyi Yang, Ying Wen, and Weinan Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.664569Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:ef47a31e94aaecc6e29ebc9f9a41ffcc2b5f2a68c699476ec1f8cfefda3986a0","observation_id":"b76e8ca0-1475-4b0d-8565-7ec62200a0e2","resolution":{"observed_at":"2026-08-15T17:19:46.664569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.668507Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.668507Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:444ea66a6b9f8ff68f3abb1ae5aefe579eecd74b82472d80fee9950246689fc4","observation_id":"d6ea1174-4c35-4ef0-931f-4ffa6b18f3df","resolution":{"observed_at":"2026-08-15T17:19:46.668507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-08-13T07:37:18.494967Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-15T17:19:46.672374Z","title":"Swe-rl: Advancing llm reasoning via reinforcement learning on open software evolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.672374Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:2153bb01d812fe866dfbf2d16a98e33b5d99ae19f7aa2d1924a01550b5fff91b","observation_id":"b49273bd-e940-414d-b5ec-bce514bfdff2","resolution":{"observed_at":"2026-08-15T17:19:46.672374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-15T06:47:01.322120Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-15T17:19:46.676046Z","title":"Reinforcement learning with verifiable rewards implicitly incentivizes correct reasoning in base llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.676046Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:8786700fd01eac332d65296c6708a8083316f5cec34d825f230ea0ac3f7f5cdf","observation_id":"b68e03fb-8021-4f54-b2a5-cb5efbcfa408","resolution":{"observed_at":"2026-08-15T17:19:46.676046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.680719Z","title":"Rlvr-world: Training world models with reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.680719Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:33efc782f2e300acebfa25d3e7e70d5bdea000f4813366b6270047c31e2ddf93","observation_id":"ea8d5ff3-2a6b-4bcd-8af6-f078c415f734","resolution":{"observed_at":"2026-08-15T17:19:46.680719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-16T12:40:48.744732Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T17:19:46.684636Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.684636Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:9f2d3222ac982a57768f500dbe85da96f4ef939dfe130c83380907c167ad60ac","observation_id":"30cb60d8-9c69-45c1-8da3-8c4b6d8d5319","resolution":{"observed_at":"2026-08-15T17:19:46.684636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.21233","last_updated":"2025-04-30T00:04:35Z","snapshot_observed_at":"2026-08-17T09:18:12.049497Z","submitted_at":"2025-04-30T00:04:35Z","title":"Phi-4-Mini-Reasoning: Exploring the Limits of Small Reasoning Language Models in Math","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.21233","snapshot_observed_at":"2026-08-15T17:19:46.688754Z","title":"Phi-4-mini-reasoning: Exploring the limits of small reasoning language models in math, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.688754Z"},"links":{"cited_paper":"/paper/2504.21233","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:f8fb417ffecc467d6fd3dc5fd2512dad87eb9909fa6cec25ab5c7e9508c4813d","observation_id":"2536eb08-d3cc-4ee0-a53d-7c14dec8db69","resolution":{"observed_at":"2026-08-15T17:19:46.688754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:47.926086Z","title":null,"venue":null,"work_id":"347ba19d-c5f2-44d6-9a5c-72d6697477ea","year":2024},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.692559Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:e4cae4313c96c0683f4b02ef4abf1e16794efec08e86edf482c624858ec07476","observation_id":"8a364484-5e2a-491d-9356-873fcff38a0d","resolution":{"observed_at":"2026-08-15T17:19:47.930327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T17:19:46.696165Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.696165Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:733e17b9ac410965f1e0309a325a5af1b8ad31cf617e85d09d86e9cfcec58b26","observation_id":"349fc563-0175-4f33-b289-f000cc71b7a3","resolution":{"observed_at":"2026-08-15T17:19:46.696165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.699710Z","title":"Treerpo: Tree relative policy optimization, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.699710Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:5b48a6b82bdc5d800f63029a7a895f103c2e8192f3e7bbaa62f61d0fd7185efd","observation_id":"7a147ee5-e9af-423c-bcb8-e23668805dce","resolution":{"observed_at":"2026-08-15T17:19:46.699710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-15T17:19:46.703635Z","title":"Limo: Less is more for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.703635Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:299200868050deed80f179b789ca16b203016bb0f2a11e5690303be9080c5eb4","observation_id":"cca10bc2-ba30-4015-879a-2d47cc5917f3","resolution":{"observed_at":"2026-08-15T17:19:46.703635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:47.913842Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":"7395988f-8b8e-4c5a-a43f-44cca35b8e4f","year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.707418Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:9cd84448c2a5a0e2adde789664536b9dc5794cb01b28407f70a2ed2afad68c8f","observation_id":"6909db26-c4a7-4eba-b806-47763d3c1d22","resolution":{"observed_at":"2026-08-15T17:19:47.917925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-15T17:19:46.711017Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.711017Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:60483867b829e98c69058781d533e9b1852755e84344e66810229330d1a54305","observation_id":"c7e23046-74c3-432f-bca3-3e320e6856b8","resolution":{"observed_at":"2026-08-15T17:19:46.711017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:47.901649Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization","venue":null,"work_id":"f53d445c-c0ba-43f7-aefb-24b48a0cf4bb","year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.714963Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:5ad0e48a3a0c973bd40ca0feb61ca0a21025015a613d4ad90993576f64a6396a","observation_id":"77fd2a2b-5bef-42fc-aafd-5b6f5da33df2","resolution":{"observed_at":"2026-08-15T17:19:47.905804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-14T16:24:43.409019Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-08-15T17:19:46.719051Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.719051Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:ac8d04a12993dc2fab7dc7489e3391bdeeac884c896cf30f2d46634529e52ace","observation_id":"d084dc3c-910a-4cbc-9535-8d8786694e82","resolution":{"observed_at":"2026-08-15T17:19:46.719051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.723728Z","title":"Disco balances the scales: Adaptive domain- and difficulty-aware reinforcement learning on imbalanced data, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.723728Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:7900765bb57d99e0895f035aa0416a14a411d08810bcc12bf75cf20f8a6a46d8","observation_id":"bfc47b08-9b7a-4a03-80dd-de0235f3c273","resolution":{"observed_at":"2026-08-15T17:19:46.723728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.13404","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:19:46.811403Z","title":"A technical study into 0.5b reasoning language models, 2025","venue":null,"work_id":"0ecce2e2-15d0-4c7a-9513-67aab5bcdf52","year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.727588Z"},"links":{"citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:3af94026bc64bbe0cc920d8efef4ddc5f7fb31756cd22ccfa4f8dc9052590737","observation_id":"a779c09c-06eb-4a63-97fe-ad541edafe3d","resolution":{"observed_at":"2026-08-15T17:19:46.821203Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 5 inbound Pith citation observations for arXiv:2508.13023."}