{"as_of":"2026-08-18T01:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0d125643851e7c60f564862e75adea53f2ca977b7b8dc6309592b5d67d98eea","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:31:38.586086Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:19:46.624230Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:48:56.210532Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2508.07809","last_updated":"2026-04-20T09:03:51Z","snapshot_observed_at":"2026-08-15T19:21:09.581562Z","submitted_at":"2025-08-11T09:49:01Z","title":"EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T23:56:47.274169Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2508.07809"},"observation_digest":"sha256:16aacd25760f40c22dba7ec98affd74e13054595a30cbdf32ead3e8a839bdfe7","observation_id":"ae143971-845e-4b2c-a967-2259fae6503a","resolution":{"observed_at":"2026-05-18T23:56:55.008684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-15T17:19:46.624230Z","title":"Adaptive guidance accelerates reinforcement learning of reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-17T23:05:26.672365Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.624230Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:b7c1504ad91513c01c35caa1db8a0e1978623d2bbf1e3f4fad7698f070047db8","observation_id":"daff95ec-0fc9-4ba0-9be5-c2f08db63c37","resolution":{"observed_at":"2026-08-15T17:19:46.624230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2509.21882","last_updated":"2026-05-25T20:11:55Z","snapshot_observed_at":"2026-08-15T23:13:38.962889Z","submitted_at":"2025-09-26T05:06:25Z","title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T14:24:48.666197Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2509.21882"},"observation_digest":"sha256:b50abf9849d3ee44f3d505b2adab69cd2bb70ac60e2d5ac6de41756cdbc02bfc","observation_id":"a5a87b9b-3829-498b-a3b9-57b85d3d4566","resolution":{"observed_at":"2026-05-18T14:26:28.367388Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-15T15:48:29.431431Z","title":"HKU NLP and collaborators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.21882","last_updated":"2026-05-25T20:11:55Z","snapshot_observed_at":"2026-08-15T23:13:38.962889Z","submitted_at":"2025-09-26T05:06:25Z","title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:48:29.431431Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2509.21882"},"observation_digest":"sha256:262e20e403565f6efff50a5151021332c291b9b70f885dc1b5873fe447806f2f","observation_id":"ab55c3cc-e7da-457b-9948-d3f526203de4","resolution":{"observed_at":"2026-08-15T15:48:29.431431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-04T10:53:08.661292Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.661292Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:e932425b4992339481f92403ef53160ddc65d5d40f12d93b714b6d30c67aaad6","observation_id":"11411b44-0b68-42f9-aeb6-eab51a369da2","resolution":{"observed_at":"2026-08-04T10:53:08.661292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-12T14:20:35.464221Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:28:18.615371Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:fd84610a1957d46d3fa047b9345ec0975bac4eedec7a0177f34438cf07bf9568","observation_id":"c4ef3d49-52e8-4f36-943f-efa6b001fcff","resolution":{"observed_at":"2026-05-13T01:47:05.199208Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-12T14:20:35.464221Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T21:20:24.066520Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:06f850db1d27c0f7ebd5e2452671f591464fd49e32a13ce358a59cfb35f6c7de","observation_id":"f6f35c7f-8dc4-4247-968c-0dd26bff82cf","resolution":{"observed_at":"2026-05-14T21:22:59.342700Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-08-11T09:18:52.581172Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:0c56febf39b1873082f6dc2fd04a697da956a16ccdc04d450999b83ee72ef95d","observation_id":"2cf22fff-26b7-4055-817f-97f6907687bc","resolution":{"observed_at":"2026-05-13T05:07:17.751601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2605.25198","last_updated":"2026-05-24T17:59:06Z","snapshot_observed_at":"2026-08-15T10:22:50.710663Z","submitted_at":"2026-05-24T17:59:06Z","title":"Hide to Guide: Learning via Semantic Masking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T12:16:12.108715Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2605.25198"},"observation_digest":"sha256:70fb8f44d7397c79d7a22bbb3925a1b5c37894deba0389774d1b1d176a1b42ff","observation_id":"155a57b7-919a-4bda-89cb-84696c4310ee","resolution":{"observed_at":"2026-06-30T12:34:39.107566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":"2506.13923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-03T20:48:56.210532Z","title":"Shubham Parashar, Shurui Gui, Xiner Li, Hongyi Ling, Sushil Vemuri, Blake Olson, Eric Li, Yu Zhang, James Caverlee, Dileep Kalathil, and Shuiwang Ji","venue":null,"work_id":"a0eba3eb-bd91-4d3d-bb05-c395ae033c2d","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-10T09:12:54.601851Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:80336c3e0596977ebd8d448f2afc49841f9f72c0b9c218c0aae4a46851d9d050","observation_id":"9ca26ac3-6aa4-4d9d-99a9-9af34efbb577","resolution":{"observed_at":"2026-07-03T20:48:56.211961Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-02T14:45:22.917496Z","title":"arXiv preprint arXiv:2506.13923 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16205","last_updated":"2026-05-07T13:16:09Z","snapshot_observed_at":"2026-08-05T18:20:48.142001Z","submitted_at":"2026-05-07T13:16:09Z","title":"It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T14:45:22.917496Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2607.16205"},"observation_digest":"sha256:ba13589f477eb8985bafcffcaaa4c03150c6886461fd838a724f64d9e37853f0","observation_id":"8c9260d2-455f-405f-93e9-c5f57909abad","resolution":{"observed_at":"2026-08-02T14:45:22.917496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-08-01T01:28:56.693276Z","title":"arXiv preprint arXiv:2506.13923 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27787","last_updated":"2026-07-30T07:21:34Z","snapshot_observed_at":"2026-08-17T04:15:29.793152Z","submitted_at":"2026-07-30T07:21:34Z","title":"LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T01:28:56.693276Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2607.27787"},"observation_digest":"sha256:ea96ac336590ad3129e9945576f8db4c9f3480d8ed5fc9b6cfb01f96fa67770a","observation_id":"994c961a-99d7-4a9e-8378-21d7cd9ceb46","resolution":{"observed_at":"2026-08-01T01:28:56.693276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13923","snapshot_observed_at":"2026-07-31T02:45:28.621215Z","title":"Adaptive guidance accelerates reinforcement learning of reasoning models.arXiv preprint arXiv:2506.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-14T08:45:07.037173Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.621215Z"},"links":{"cited_paper":"/paper/2506.13923","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:75860ec9094eceae9a0c6a0fe4f5525a322136c60f3a6024e2763c6e98b956a3","observation_id":"44f73572-76ad-4cac-a237-d43b714ec9a0","resolution":{"observed_at":"2026-07-31T02:45:28.621215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13923/citation-record","integrity":"/paper/2506.13923/integrity","json":"/paper/2506.13923/citation-record.json","paper":"/paper/2506.13923"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T00:31:33.630703Z","title":"Richardson","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.630703Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:15ec9d26b740084e1a9e9094d973e51afdd671005526d9073e0d6718cb070b3f","observation_id":"93c69185-51db-403f-b91c-1b1ce5ffd1d1","resolution":{"observed_at":"2026-08-07T00:31:33.630703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:31:33.673149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.673149Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:42134de1c6ce10f9604b4dbb7ac4497d94dcf29a275f85d58993f3d952fa90b3","observation_id":"a8988f1e-0c2e-4284-bd35-823af1320e74","resolution":{"observed_at":"2026-08-07T00:31:33.673149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T00:31:33.763546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.763546Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:5c042aa50f6d8e2d3d6acb9cae326410b5da68f10c9452217bcb8a27c350d1e4","observation_id":"b7ba5a2e-91c5-42a3-9966-0dd733e5b83c","resolution":{"observed_at":"2026-08-07T00:31:33.763546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:33.824990Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.824990Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:2b403b0c00df96f565e9cae9b9a9ba5aa3f8e5e49a20d31b386f8944dfc7326d","observation_id":"aeed9b1a-ca68-44e7-a2ec-7aa18495b3a8","resolution":{"observed_at":"2026-08-07T00:31:33.824990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T00:31:33.883507Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.883507Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:cc61cdc911393641d2b3fc53d97775fbc0e3f705167ed786f2375d1e8ee4abd2","observation_id":"d0963d46-c208-49b6-a62c-dfbab7fe6557","resolution":{"observed_at":"2026-08-07T00:31:33.883507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.879179Z","title":null,"venue":null,"work_id":"72265293-c459-4ae9-b0ca-b318c913f628","year":2022},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:33.976587Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:11486ddb9716232f2969cc474653b7f8e32844fc0049c6078a04dac57fa015d7","observation_id":"13e84987-c960-42bc-9126-4f976a084cc3","resolution":{"observed_at":"2026-08-07T00:31:42.968767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-07T00:31:34.071107Z","title":"Reinforced self-training (rest) for language modeling.arXiv preprint arXiv:2308.08998, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.071107Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:6baaec2dcaafbaa6e5a7c828227d099e7bc2cae261cea6f99aae3041071c7ca0","observation_id":"e30394ea-1a98-4aed-b777-7263413883c9","resolution":{"observed_at":"2026-08-07T00:31:34.071107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.658498Z","title":"Openai’s reinforcement fine-tuning research program, 2024","venue":null,"work_id":"cb58c500-e5b1-455d-972a-ad797f2577e0","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.138304Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:58b5268cf1785edb7e37b9b82eb42ac97d328e826d2e31b15e437e8b52ae4e7f","observation_id":"689b6931-b901-48bb-96f4-67616561938a","resolution":{"observed_at":"2026-08-07T00:31:42.742679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.511905Z","title":"Be- yond human data: Scaling self-training for problem-solving with language models.Transactions on Machine Learning Research, 2024","venue":null,"work_id":"4663038b-e642-4eee-9c00-3fd0fd9d755d","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.205487Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:fc2f85e372ff1318a82784fbe393eed5895ae643a5b560441f1bd386b406e7a1","observation_id":"c1892acf-dbe5-43b7-95c3-e78b068ceaea","resolution":{"observed_at":"2026-08-07T00:31:42.566202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.386827Z","title":"V-star: Training verifiers for self-taught reasoners","venue":null,"work_id":"3d677821-f61c-4b1c-83a1-da85f9fce07b","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.323233Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:2eb3d9ef9115f37016532a402a1d3169345b3f5e2b0473402649a8581971b081","observation_id":"77cc6ec1-5c4b-4636-94df-9c093f623c76","resolution":{"observed_at":"2026-08-07T00:31:42.501094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.173465Z","title":"ReST- MCTS*: LLM self-training via process reward guided tree search","venue":null,"work_id":"fa784609-7fcd-436a-957d-51022d8befee","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.410205Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:8e22f01eebdf62d584d5f11b80cef6e0105b6c0bf5b15e8ba5b129490982bdda","observation_id":"c2bb22dc-bb45-4d6b-ab4c-61751a999089","resolution":{"observed_at":"2026-08-07T00:31:42.266560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T00:31:34.508482Z","title":"Continuous control with deep reinforcement learning.arXiv preprint arXiv:1509.02971, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.508482Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:75b87b09546ad29a192ba8be246c873c31cb4a2ffceca3b7c777e0f0d0326acc","observation_id":"b2a05105-dcec-47c0-9c68-e37529ec670d","resolution":{"observed_at":"2026-08-07T00:31:34.508482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:31:34.635249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.635249Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:c99d719415f964cc1c1f83b581def5a2727805cbcee469eb2a38234d65260528","observation_id":"b0c55e14-5657-40b7-af77-ff320e39af2b","resolution":{"observed_at":"2026-08-07T00:31:34.635249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T00:31:34.851692Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.851692Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:945b8565b86d4a12ea7404c9ee5aeb05bb9378323594efedaca3888ec227ca1a","observation_id":"503ce4ba-3497-4e35-aff9-16f65a6e7112","resolution":{"observed_at":"2026-08-07T00:31:34.851692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:42.048764Z","title":"Aime 2024","venue":null,"work_id":"174ea1dd-ba58-4636-9d53-af6caadba023","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:34.924828Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:fc648e3b872db296848b3ba2822a7bccd0219dfaf8482fee28397ec3b095c1f3","observation_id":"a94a7577-dd41-45a5-befa-721617b21833","resolution":{"observed_at":"2026-08-07T00:31:42.081687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.961167Z","title":"Aime 2025","venue":null,"work_id":"39bfcb7c-30de-417a-91ba-299bf22cc1c0","year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.021740Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:f5720eb013f02febb935db2429b7238d17faa93c2ea2722746f4806595da31d9","observation_id":"27f7e066-ca93-4f55-bde1-e8f978f7cb64","resolution":{"observed_at":"2026-08-07T00:31:42.010708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.840385Z","title":"Amc 2023","venue":null,"work_id":"b8e8373d-9d4d-4bf5-86a2-0c50396453b2","year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.145729Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:300991dedf30e16eafa658a5e5d787220e311b58234d8d7d52e3198d7909a4d3","observation_id":"5a8cccb6-bcf6-462a-af42-818c0d348387","resolution":{"observed_at":"2026-08-07T00:31:41.885367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:35.213884Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.213884Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:c7aca86d7abaff24ee42da8cf75011f15418caaa8192163ccc1f97f1a248e133","observation_id":"07087427-359a-4e9b-9f33-1c67cb2dfdfa","resolution":{"observed_at":"2026-08-07T00:31:35.213884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T00:31:35.273503Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.273503Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:ed54d9e18246333e95cb16fbd3130ecfd188ec44ac927b9e9dcbf12b2e5fe4a4","observation_id":"c05f9dc9-279f-4538-b816-a2bec136b49b","resolution":{"observed_at":"2026-08-07T00:31:35.273503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T00:31:35.407856Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence.arXiv preprint arXiv:2401.14196, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.407856Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:eae1c5a87aef69d6ad7db58de99876d23eba5f60ec6bfddc0b31d0f100d16fd3","observation_id":"beb9fd64-2327-4d99-9065-6f3e2b8f317e","resolution":{"observed_at":"2026-08-07T00:31:35.407856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.736930Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint, 2024","venue":null,"work_id":"03027b48-51bb-48c6-9b65-e7b1f24bd7e0","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.477463Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:754a15334234c75154ef81b0371179456b75c90fa0bf81b409706b3396046ebd","observation_id":"2577b0f8-e45f-4c7a-a99f-bf593af79254","resolution":{"observed_at":"2026-08-07T00:31:41.787072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T00:31:35.563471Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.563471Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:397379f864dc8fd2c39c0e75f7691733c290dd16d6de99ba0111a57d44af9867","observation_id":"098d9765-40b6-4420-900c-835487736344","resolution":{"observed_at":"2026-08-07T00:31:35.563471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:35.647369Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.647369Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:dbc8ecf5854ac18d98bf254ff1100b0f3d1c199417dde96b164c5e9ade7dbb41","observation_id":"35b5e4f3-a3a6-487f-a86d-414cb3cac3d3","resolution":{"observed_at":"2026-08-07T00:31:35.647369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:35.732089Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.732089Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:35f70514374e11b1ca009b45c9b36ce58366b5e325aa2e883b90720d69a5b283","observation_id":"a9ff5d5f-0123-4e33-b672-8e7b2dd1c244","resolution":{"observed_at":"2026-08-07T00:31:35.732089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T00:31:35.831960Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, Tom B","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.831960Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:c9286271af2fefb56f7de1fd4246a4cf9d4fe47e2430546f590784dd5288e5d6","observation_id":"c7094ab0-9a3c-441e-b0b6-b7e5c9eb3c5e","resolution":{"observed_at":"2026-08-07T00:31:35.831960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.575164Z","title":null,"venue":null,"work_id":"c024cd66-4d20-44b4-980e-349e8f2ddc95","year":2022},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:35.904313Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:a3c97dfb076475a4bd347110e2df4bd14e7c77f42aea745d36789a2314f891c3","observation_id":"97b7a885-7d76-403d-8754-9278b13936d2","resolution":{"observed_at":"2026-08-07T00:31:41.628336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18232","last_updated":"2023-11-30T03:59:31Z","snapshot_observed_at":"2026-08-16T14:38:59.314544Z","submitted_at":"2023-11-30T03:59:31Z","title":"LMRL Gym: Benchmarks for Multi-Turn Reinforcement Learning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18232","snapshot_observed_at":"2026-08-07T00:31:36.028658Z","title":"Lmrl gym: Benchmarks for multi-turn reinforcement learning with language models.arXiv preprint arXiv:2311.18232, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.028658Z"},"links":{"cited_paper":"/paper/2311.18232","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:a8e988332ef8d9f3154aaf40703d1f4b61c10dce5cc53f4a041d863e86615139","observation_id":"a9c0a123-1458-4ec2-ad46-403029fe2937","resolution":{"observed_at":"2026-08-07T00:31:36.028658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.447912Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"7cb207f6-ae8e-4685-b985-3000c4184274","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.112436Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:39f8d135841bfe58c7e8efa206a9bad1a8632727387ff73cf4516d92f530a540","observation_id":"c63c58de-bbae-4044-892f-a21618e9f075","resolution":{"observed_at":"2026-08-07T00:31:41.511850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.336849Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":"f9d3fe5e-de3f-4a1c-bbdd-0d56386db2ad","year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.165728Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:b0e17ec75be332b936ca58a7c0e25254a360d0bebd9504f3c9cc482497cecb88","observation_id":"9a9491a7-4fca-4fb7-b1ee-481b3c08470d","resolution":{"observed_at":"2026-08-07T00:31:41.386519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T00:31:36.250869Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.250869Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:0a1c1a2e97bb467998c5889f52581faaab68e5e090f0753e468f66755d7ee9d1","observation_id":"63cc29ad-0a40-48b2-b947-c9ab58369e60","resolution":{"observed_at":"2026-08-07T00:31:36.250869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:31:36.352872Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.352872Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:00d6098af3ac39e7bee90c22f06e61587cb65a49f59686d9a5d3ffefd1c0e061","observation_id":"62593bd3-d18c-4b33-b0fb-2ab464d70a43","resolution":{"observed_at":"2026-08-07T00:31:36.352872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T00:31:36.490405Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.490405Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:d7bd7173f5419cb8baa7e5c51061b253d6e2dd7faf05d33cddf7acf47af33416","observation_id":"a56e454b-536e-4593-a6ea-861ee4fba24f","resolution":{"observed_at":"2026-08-07T00:31:36.490405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T00:31:36.562765Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.562765Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:1f03eef25c5257d59261ad40acec1d2376de75842d471616fc2074998af97d00","observation_id":"43b36156-2531-46f0-b9dd-afe892cd943c","resolution":{"observed_at":"2026-08-07T00:31:36.562765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T00:31:36.601300Z","title":"Le, Sergey Levine, and Yi Ma","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.601300Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:7b3ed5df9044ec788712708444b2d4a81bc542c4cfab8a78d7d5f80847815578","observation_id":"0e997cca-1852-4654-a328-b4b1db39ef8c","resolution":{"observed_at":"2026-08-07T00:31:36.601300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:36.691691Z","title":"Scaling LLM test-time com- pute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.691691Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:4cab6bac6dff9bdf54999730a776563a864e39f6a73123eb2a911cd6cbecd0b1","observation_id":"386ef46f-11a8-45a7-9bcd-9bf7868f5487","resolution":{"observed_at":"2026-08-07T00:31:36.691691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-17T19:03:31.231829Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-07T00:31:36.795096Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining.arXiv preprint arXiv:2504.07912, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.795096Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:3e4a62a4b9f548709a8f8a032cc756eaaa88aded72ec4c20d9b66fe51c14516a","observation_id":"3f71c7fa-5d4b-4ef8-a912-a461dd82f61c","resolution":{"observed_at":"2026-08-07T00:31:36.795096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:36.881955Z","title":"Assessing diversity collapse in reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.881955Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:a796d540c30da779a363feabcaa19931dfbe5412c6ba2403a91266f724d76cde","observation_id":"9fb8845d-8e9c-4e18-981d-6214dbf83a0d","resolution":{"observed_at":"2026-08-07T00:31:36.881955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:36.976302Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:36.976302Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:20407bcedaca9675a0c5306aa0a8f6372f4706224e6b6aa8af36e3da06b7d480","observation_id":"fee6f11f-2095-4421-a497-0c9994c674eb","resolution":{"observed_at":"2026-08-07T00:31:36.976302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-16T12:48:57.666544Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-07T00:31:37.043476Z","title":"Bellemare, Jonathan Lebensold, Arnaud Bergeron, Joshua Greaves, Alex Fréchette, Carolyne Pelletier, Eric Thibodeau-Laufer, Sándor Toth, and Samantha Work","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.043476Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:02b4eab4031d5a706c6896dfc8ee1fe007d5410c81c4862412b0d5801e53276b","observation_id":"699988d1-d4a5-403a-b834-fa3f35c6c9b9","resolution":{"observed_at":"2026-08-07T00:31:37.043476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-07T00:31:37.128523Z","title":"Learning to reason under off-policy guidance.arXiv preprint arXiv:2504.14945, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.128523Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:3041a69e752191f62374d8b5f93aa5dd2b9bbf27b69e8b6df2e0bc5aae90d8c9","observation_id":"eaf1f6ed-4b5c-439f-ad65-cf6251c95323","resolution":{"observed_at":"2026-08-07T00:31:37.128523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T00:31:37.204240Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.204240Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:926097cdc9a2b0cd4a11ae858907367f186e84f6f24aebe1cd9d3b32a47e105f","observation_id":"3294b235-12d3-4aea-af15-30508f14116f","resolution":{"observed_at":"2026-08-07T00:31:37.204240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.171250Z","title":null,"venue":null,"work_id":"2f49f6af-95d8-4799-be0b-09d02f9a9336","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.313993Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:dd520d7194e3c87b307a82066b7cc2f5c68e61e15668f8073ae7f04aafc1084b","observation_id":"2cbc1157-af60-4496-8d47-c2d7ac995883","resolution":{"observed_at":"2026-08-07T00:31:41.227473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:41.059035Z","title":null,"venue":null,"work_id":"63f2aacc-2a43-4368-82d0-928b8fb16372","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.393926Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:75d25b988e12b85816ae6fec9b7659e1696f21ecbdee24191b69d17628c1db64","observation_id":"0b287539-eb83-4218-bd02-e499e193e097","resolution":{"observed_at":"2026-08-07T00:31:41.116242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.959460Z","title":null,"venue":null,"work_id":"8512ead1-7f23-40a2-a310-f05c67d90a44","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.478330Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:d5f82bc1e5973fffd4e0e217f9700d60b351bfc76718c62be7b4b76e9e4ca643","observation_id":"3ed7525f-09d6-411a-9a85-7468a3918160","resolution":{"observed_at":"2026-08-07T00:31:40.987925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.850627Z","title":null,"venue":null,"work_id":"8c0d5156-c7ee-430f-b125-b5c816771b02","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.558393Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:e7d75fd6a5949b1b03f12bc715afed19f5ea69fbbfc651d5fa19f54faafe5426","observation_id":"b6d942a2-c234-4217-98f2-f56e1763451c","resolution":{"observed_at":"2026-08-07T00:31:40.908596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.711669Z","title":"A hint to the problem is provided below: [HINT_START]","venue":null,"work_id":"499b107b-66f6-419d-a87d-dfc2b0281e41","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.607764Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:6a693f53fa38f0ae36ba0830195fa9cb531b7172bdf375490ecb105dc9f52efb","observation_id":"2bc9a944-19ff-4b71-bdeb-cc3b8a69008b","resolution":{"observed_at":"2026-08-07T00:31:40.776609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.561634Z","title":"Think about how the identity (a²/4) - (4/a²) might be used as a building block for factoring the larger expression","venue":null,"work_id":"b04380d2-6f61-4a00-946d-b59f7e215b1e","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.657446Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:5d6e9ae63f417c96783f5e3b29542c3dd00ff09e93cb9ab8d4b6b7b1994377fb","observation_id":"85b570b4-9fb5-485c-b190-aab6de5316ce","resolution":{"observed_at":"2026-08-07T00:31:40.646643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.377575Z","title":"Ask yourself if a difference of powers or a recognizable factorization pattern might help connect the two parts of the expression","venue":null,"work_id":"181fd6a3-7390-4fef-90b9-644fe25ddae7","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.765087Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:d4263a7a95d66a7b0340bef60f3020746b9f5f423bc1c0bdab39bf38d91bbf9c","observation_id":"e13d6c72-369a-437f-ad8c-5d16f7844303","resolution":{"observed_at":"2026-08-07T00:31:40.472946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.261895Z","title":"How can this substitution simplify the structure of the problem? ,→ ,→","venue":null,"work_id":"20c1beca-4edc-4b22-ae2d-6fb8541dd9b3","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.850950Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:ae7ca869f1182330a54ef990eccafc3e27321f1a50bcee32044f4323b393b8e1","observation_id":"a818a75b-c756-4365-9c30-8c403835893b","resolution":{"observed_at":"2026-08-07T00:31:40.307652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:40.110552Z","title":null,"venue":null,"work_id":"a3f96dfa-2cf4-485e-9b3b-7abb7cc42141","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:37.940379Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:b343c041e71098a7f71a279e4093c4ad207cb729898bc8af4ff07ee12fc89536","observation_id":"ea984d5a-4322-41c4-93a6-29d8d3507596","resolution":{"observed_at":"2026-08-07T00:31:40.185924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.936877Z","title":"Use these observations to guide your step-by-step approach toward the final simplified result","venue":null,"work_id":"54475180-9490-44de-a4ca-411ed614d712","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.063163Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:d5dfdd87e1c02def0d435e28650d3c646bf240ee888af602074ccc1c99329363","observation_id":"5ecf4a51-a6e2-4c78-aa2a-0f184f08c3db","resolution":{"observed_at":"2026-08-07T00:31:40.020913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.803890Z","title":null,"venue":null,"work_id":"7333b306-783d-4de8-a35b-77a1b8d3cb13","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.128400Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:40e575e67e037744d872294fb56e2800767f716baaa8d7463b9d313dec6d6fbf","observation_id":"c4566f0d-4b2d-4f7c-a2b6-124fc1a5569b","resolution":{"observed_at":"2026-08-07T00:31:39.842436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.735547Z","title":null,"venue":null,"work_id":"c896084a-605e-440b-9f20-f0199278e6ff","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.201603Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:9ca68a66297efd3fa45abdd01b01b1133eb24821b9e4eade6a6f7bf4d83fccb4","observation_id":"d504db0d-c856-45e5-804c-5eb4622496fe","resolution":{"observed_at":"2026-08-07T00:31:39.762269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.556338Z","title":"What does that imply about multiplying the side length? ,→ ,→","venue":null,"work_id":"431f2c18-d450-4ac6-b075-09d1a531e201","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.255892Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:5704dfaa7dfe604fc33baa08fd27bb6e3ff0d9e8e128f36f206244a779aeac59","observation_id":"b03f974b-9501-4cfc-9c19-0e6a97c4b804","resolution":{"observed_at":"2026-08-07T00:31:39.645444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.442882Z","title":"Ensure each step follows from the properties of a square.,→","venue":null,"work_id":"b7040236-e09b-4f61-8081-3f2a84c64d7d","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.345981Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:9d537403a07329d5f0fc3e1a3cd3cd20f38823401462eaaf912dbfbcf368407e","observation_id":"e8681102-13af-4343-9de8-61d3a7d873a2","resolution":{"observed_at":"2026-08-07T00:31:39.495423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.299730Z","title":"using the hint","venue":null,"work_id":"507ac192-a135-4cf0-b60d-e65dd82b9573","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.429016Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:ffdb63cefb7340bc011af05369744fb761aa80ca28c7c9a62728e5fedfd73db3","observation_id":"a5312c55-30df-4e3f-bd80-b29e1640dc0b","resolution":{"observed_at":"2026-08-07T00:31:39.367706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:39.107069Z","title":"This example shows how a concise, domain-specific hint can redirect the model’s reasoning and correct a systematic geometric error","venue":null,"work_id":"7641eea3-93f6-479c-875e-9d75cd712af9","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.509431Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:36f964e6d39671dfa2fd433a29e6eeb5697467952520f3126e0bd0ceb6cb1e28","observation_id":"79e676a7-60b4-4be4-b507-194276321478","resolution":{"observed_at":"2026-08-07T00:31:39.190927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:31:38.928910Z","title":"<think>\\n {thoughts} </think>\\n\\","venue":null,"work_id":"692718a0-0115-430b-9328-021148fa77a7","year":null},"citing_paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:31:38.586086Z"},"links":{"citing_paper":"/paper/2506.13923"},"observation_digest":"sha256:931cfef7689b6cce971cd901a59c8f73ea716fa5a06519c0f372d4c0b798c621","observation_id":"9efcd0cd-68c1-4bd7-bcb7-2855da000ad5","resolution":{"observed_at":"2026-08-07T00:31:39.011456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.13923","last_updated":"2025-06-20T00:51:15Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T19:34:53.671134Z","submitted_at":"2025-06-16T19:03:06Z","title":"Adaptive Guidance Accelerates Reinforcement Learning of Reasoning Models"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 13 inbound Pith citation observations for arXiv:2506.13923."}