{"as_of":"2026-08-10T11:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09e4dab666aa747f0ffa7048960ab31b64fd6b34e3d0ea17f76c92429c66ca46","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:33:58.345391Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:22:11.829438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:47:59.849796Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:ca94840f3fae8f903392e2797c3a3356c338e18e7bcaaa7579b0f75308deaec9","observation_id":"b4d40336-1471-4269-b24f-77da40690d0f","resolution":{"observed_at":"2026-05-18T19:21:48.638499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2604.06804","last_updated":"2026-04-08T08:17:25Z","snapshot_observed_at":"2026-08-02T18:54:27.178723Z","submitted_at":"2026-04-08T08:17:25Z","title":"LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:04.225059Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2604.06804"},"observation_digest":"sha256:47db3b4faab6dea7c24b3028694ac8e38e2f1119f3b214ca2eee0a99ac3f5e77","observation_id":"db8baea6-a880-4384-a29e-9fd1060a96ae","resolution":{"observed_at":"2026-05-11T07:16:02.195880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2604.16972","last_updated":"2026-04-18T11:43:08Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T11:43:08Z","title":"MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T07:05:45.081955Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2604.16972"},"observation_digest":"sha256:64e0c731899fdca65456bb8e4d743f62b39981f17c1f67338b449493f00b6e1a","observation_id":"332989d2-bc58-4d9e-b58b-55c974b8e2be","resolution":{"observed_at":"2026-05-10T07:06:52.840498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2604.28020","last_updated":"2026-05-29T15:07:05Z","snapshot_observed_at":"2026-07-06T23:13:24.960159Z","submitted_at":"2026-04-30T15:39:09Z","title":"Cost-Aware Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T05:11:01.131590Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2604.28020"},"observation_digest":"sha256:64f5aefca75a6c089e3f1ec7c51f5aed9a8003aac587836db5d54ee1e27c2a7f","observation_id":"3644689d-62f7-4cea-8a5c-5ec10e9c720c","resolution":{"observed_at":"2026-05-12T10:36:30.855968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":184,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:4af5c48aa358e9ed63df4a3761e60adf1b3f14d1a20352a550e935ac63fa58b4","observation_id":"920e3085-d9e2-44c6-a90f-4243e10ddbe6","resolution":{"observed_at":"2026-05-10T23:15:49.463309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.05802","last_updated":"2026-05-07T07:41:09Z","snapshot_observed_at":"2026-08-03T11:14:43.716738Z","submitted_at":"2026-05-07T07:41:09Z","title":"Selective Rollout: Mid-Trajectory Termination for Multi-Sample Agent RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T15:31:23.161009Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.05802"},"observation_digest":"sha256:62cf41057c5ebe9e2673658e006b1122f1aea92807da836655a57d713a2cd656","observation_id":"cb3b60b6-8cee-4536-9fa1-7a060ba2fb04","resolution":{"observed_at":"2026-05-11T16:41:09.059414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:f41b5cc7737faf0ef4d8a44cf879211ea3bd2eea953672280be863cd7c52c446","observation_id":"1bd91141-483c-4119-97cc-f75940b57616","resolution":{"observed_at":"2026-05-11T21:31:15.988767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:88eee84b96bfe9ae0867316b1145e6ab2a74bd09af9f86eec6b23f8f30685b6e","observation_id":"99e4c427-1350-4aaa-bef3-db35fa1bc34b","resolution":{"observed_at":"2026-05-21T08:39:53.200705Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:3d0b42bc8314b44ff632076b2e7c571286067c985ec9fab2be33a3debdafb041","observation_id":"e8dfdb1f-37e0-4527-abcc-0816e3b30fcd","resolution":{"observed_at":"2026-05-11T03:55:56.733368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.07579","last_updated":"2026-05-11T03:09:39Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:49:36Z","title":"Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T02:08:28.113371Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.07579"},"observation_digest":"sha256:576ee35a130bb11f607881b344ffdf3282c06e1818cc8b3659bc6cb7c7f3f608","observation_id":"56fe42d0-5d57-4e03-8d3e-2fa1432befd8","resolution":{"observed_at":"2026-05-11T03:55:54.882249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.07579","last_updated":"2026-05-11T03:09:39Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T10:49:36Z","title":"Your Language Model is Its Own Critic: Reinforcement Learning with Value Estimation from Actor's Internal States","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:25.989133Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.07579"},"observation_digest":"sha256:5ae3a7db5cde635da87b1065cabf61d394a7f75e0ccea82796225334c5132dff","observation_id":"1bb2620f-65b2-4965-a974-ffd22c58c6b1","resolution":{"observed_at":"2026-05-12T06:41:45.835310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.08441","last_updated":"2026-05-08T20:03:19Z","snapshot_observed_at":"2026-08-02T05:33:25.541249Z","submitted_at":"2026-05-08T20:03:19Z","title":"DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T01:57:11.065744Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.08441"},"observation_digest":"sha256:36df2811059610d9b1b14086bc6cf6c49f094867e4ea5c25fbf01e8950efab75","observation_id":"f86cb607-eed8-4ff2-a252-14fb94b01f17","resolution":{"observed_at":"2026-05-12T07:46:28.647091Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.09188","last_updated":"2026-05-09T22:05:59Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:05:59Z","title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:49.428954Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.09188"},"observation_digest":"sha256:0777b2b262c85b128af03f5cc1ac7def3b9b73e728db064094c5c966ed78d6b1","observation_id":"12169cac-4b43-40bd-ae4d-62099273376f","resolution":{"observed_at":"2026-05-12T03:16:19.327965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.11235","last_updated":"2026-05-11T20:50:29Z","snapshot_observed_at":"2026-08-10T03:47:46.321583Z","submitted_at":"2026-05-11T20:50:29Z","title":"Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T02:19:27.345348Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.11235"},"observation_digest":"sha256:9a3107c5344a8b9b4592cd8b167361e22d0e5b95f175efbc3d86b5dd3008b652","observation_id":"117727e2-7d6b-4893-9a70-1b6ea6b10b7a","resolution":{"observed_at":"2026-05-13T02:22:06.806520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.13907","last_updated":"2026-05-13T03:36:57Z","snapshot_observed_at":"2026-07-06T23:25:25.361350Z","submitted_at":"2026-05-13T03:36:57Z","title":"AIS: Adaptive Importance Sampling for Quantized RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T03:13:14.384567Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.13907"},"observation_digest":"sha256:af5e5ede8fd7e2f16ca0bf395b08d13e7a222cf87987ca3b8e0d15f948921435","observation_id":"39a0d34e-3e63-4bc3-b2c7-ecb5096dfb5c","resolution":{"observed_at":"2026-05-15T03:14:52.595524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.15113","last_updated":"2026-05-18T19:19:17Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:27:34Z","title":"Learning from Language Feedback via Variational Policy Distillation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T20:34:36.764090Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.15113"},"observation_digest":"sha256:c2812053cecd3a3a1154fc127af82e27a8babd4949cce02d3d34047e152ca85e","observation_id":"2bd94e0d-39a0-4977-a38e-91ea45ade716","resolution":{"observed_at":"2026-05-20T20:39:00.348750Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:177ce1fa846c0b1f5f58a83b5d20e028885178ecf9deee5981cc9c81f527beab","observation_id":"72467af6-8d03-4f29-8f8f-1424b2767578","resolution":{"observed_at":"2026-05-20T20:13:43.788110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2605.26606","last_updated":"2026-05-26T06:41:13Z","snapshot_observed_at":"2026-07-06T23:36:25.432687Z","submitted_at":"2026-05-26T06:41:13Z","title":"Spend Your Rollouts Where It Counts: Rollout Allocation for Group-Based RL Post-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T19:47:09.817243Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2605.26606"},"observation_digest":"sha256:3aecda2980d5b87e7bb4b1a121e1b3648f2795f46aac216009633b0122c76021","observation_id":"942d9897-902c-48e5-9eb4-31e12c4ae2cd","resolution":{"observed_at":"2026-06-29T19:53:55.782288Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.00135","last_updated":"2026-05-28T22:21:47Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-28T22:21:47Z","title":"On Effectiveness and Efficiency of Agentic Tool-calling and RL Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T08:38:52.411671Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.00135"},"observation_digest":"sha256:2eea9b0ae981fab8d73a67e50fdf3a302780184ef36193a80ebfbd3f6019b11e","observation_id":"24f670bc-ea5d-4b7e-a474-bd4cdf87ed2c","resolution":{"observed_at":"2026-06-29T08:43:15.361248Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:79e04e853b335da5f8ff333b7dd50e146b532e3ff641d9b1eaaa701f915e67a1","observation_id":"ba73a442-9db2-4e22-ab0a-1a24cbdae46a","resolution":{"observed_at":"2026-07-01T21:16:13.345991Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f8a5f618a37d76a1da09cc211ecd80ea250a5d34512307d3724253b07ae47f37","observation_id":"4c242cd4-ec7c-43f0-901d-3edb7e28c52e","resolution":{"observed_at":"2026-07-02T12:06:56.403920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.06828","last_updated":"2026-06-05T02:07:08Z","snapshot_observed_at":"2026-08-04T19:25:01.419366Z","submitted_at":"2026-06-05T02:07:08Z","title":"AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T22:54:21.740892Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.06828"},"observation_digest":"sha256:603355159884b5dccd8ab0bca305f3fc7779f091fea236c371972e7f7bd65c21","observation_id":"9fe1ca1e-f844-438f-8466-60f0a59ecddc","resolution":{"observed_at":"2026-07-02T16:17:08.917602Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.08346","last_updated":"2026-06-06T21:29:01Z","snapshot_observed_at":"2026-08-07T19:43:22.618216Z","submitted_at":"2026-06-06T21:29:01Z","title":"CATPO: Critique-Augmented Tree Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:30:07.971424Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.08346"},"observation_digest":"sha256:afab67aca4f513be55c27fa148865b19caabf7fd4369422defc3984b2f39bcb9","observation_id":"342d495b-9320-40ba-adb9-58a2db117d97","resolution":{"observed_at":"2026-07-02T21:47:28.013303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.10768","last_updated":"2026-06-09T12:21:27Z","snapshot_observed_at":"2026-08-08T12:03:53.959178Z","submitted_at":"2026-06-09T12:21:27Z","title":"N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T14:02:05.833651Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.10768"},"observation_digest":"sha256:706b972811fdb3805375f3b95831bb2ee4f9b591fc629aee593707cc4a57199b","observation_id":"125b38d1-05be-4ade-bf2d-03ff4f6c5ced","resolution":{"observed_at":"2026-07-03T04:17:37.386022Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:fc7a94dad51b372a8a57d90b07d6e6c69ecafe5b38381422a9c7d8c0033d8a74","observation_id":"1e5be0ca-5cbb-4df1-9a9e-4cb4ed65cca2","resolution":{"observed_at":"2026-07-03T09:47:59.851250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-08-01T00:29:00.908981Z","title":"Act only when it pays: Efficient reinforcement learning for LLM reasoning via selective rollouts.arXiv preprint arXiv:2506.02177,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T00:29:00.908981Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:74bdb6996c66c28ba0237e95a61531899f839031a21949e11583b06023913994","observation_id":"3ea09dec-71d9-4b2d-9af3-1544d52c4ef9","resolution":{"observed_at":"2026-08-01T00:29:00.908981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-31T01:31:13.934392Z","title":"Bartoldson and Bhavya Kailkhura and Fan Lai and Jiawei Zhao and Beidi Chen , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:13.934392Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:c053d60948791951508df1db8a30596c79110922120f2e3019ae9abf64bdf0e9","observation_id":"90c868fa-b460-46cc-b1cf-3190f1bd4b4e","resolution":{"observed_at":"2026-07-31T01:31:13.934392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-08-05T00:22:11.829438Z","title":"Bartoldson and Bhavya Kailkhura and Fan Lai and Jiawei Zhao and Beidi Chen , title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00782","last_updated":"2026-08-01T17:29:14Z","snapshot_observed_at":"2026-08-07T03:55:00.582409Z","submitted_at":"2026-08-01T17:29:14Z","title":"Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T00:22:11.829438Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2608.00782"},"observation_digest":"sha256:33cf1daaf42329970e4c543ce44c1007fe44a020616e9e3b5b452d2181eadb22","observation_id":"79f0a914-cc9b-46b6-bf4d-f8132541aa86","resolution":{"observed_at":"2026-08-05T00:22:11.829438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02177/citation-record","integrity":"/paper/2506.02177/integrity","json":"/paper/2506.02177/citation-record.json","paper":"/paper/2506.02177"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T11:33:53.422853Z","title":"Aime problems and solutions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.422853Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:3a89e4c85e34da93dd4b7c4dedf2f4c6819ac9a4556349ed1d6bf63bacc1aff3","observation_id":"d9831c0c-05e7-4a31-a01c-0fbc8f226c97","resolution":{"observed_at":"2026-08-07T11:33:53.422853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:00.025613Z","title":"Training.Our method is implemented based on verl (Sheng et al.,","venue":null,"work_id":"33bae1b3-7798-4b4b-9044-30b98e232df3","year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.817375Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:143e56032d1956fa8d20e319cd83b74ed6d3de5275961d6dcc0fbdb4bb55283e","observation_id":"0d8a338a-89e1-47db-ba73-d11448e44cda","resolution":{"observed_at":"2026-08-07T11:34:00.133936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-08T01:11:30.324736Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-07T11:33:54.037842Z","title":"On designing effective rl reward at training time for llm reasoning.arXiv preprint arXiv:2410.15115,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.037842Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:6cfcec171156b6e0f44ea6ecacea2ec196f8aa325ae52906eb0db40ca2faef92","observation_id":"23c8d49a-973f-49ee-95cc-884995a9bb2d","resolution":{"observed_at":"2026-08-07T11:33:54.037842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T11:33:54.160410Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.160410Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:d83cefe760e9aeabb4c01e7612f1133d12b0f0e67a12c88eee08d6eae1bf8d9c","observation_id":"f9c3030d-ccd9-4bcc-bafd-d5082f7d4ebe","resolution":{"observed_at":"2026-08-07T11:33:54.160410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:01.004082Z","title":"Data-efficient finetuning using cross-task nearest neighbors","venue":null,"work_id":"ab268aff-9c15-4669-8fee-6ffda48ffbcd","year":2023},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.446718Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:4f265e8b36887296cb01a730fa88de53961eb73b1a45b1a1622e8cff046dd58c","observation_id":"1513ae04-df18-4551-b3b0-5004701717db","resolution":{"observed_at":"2026-08-07T11:34:01.140721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01807","last_updated":"2025-06-19T04:19:15Z","snapshot_observed_at":"2026-08-08T01:22:30.771699Z","submitted_at":"2025-03-03T18:37:26Z","title":"Large-Scale Data Selection for Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01807","snapshot_observed_at":"2026-08-07T11:33:54.560575Z","title":"Large-scale data selection for instruction tuning.arXiv preprint arXiv:2503.01807,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.560575Z"},"links":{"cited_paper":"/paper/2503.01807","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:53b82b2ba62a84f385588ce1d8fc672b4a58d31ca720a28779c7b912d4de7939","observation_id":"9b82e5ce-5627-4432-acbb-de0cc0225403","resolution":{"observed_at":"2026-08-07T11:33:54.560575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-05T20:06:13.107818Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T11:33:54.702600Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment.arXiv preprint arXiv:2410.01679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.702600Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:546e7cf7fb70a0cf57b9f975454e36c3425595eedada8bdb01d8db61f3055720","observation_id":"aedd8de2-cdae-4679-b01c-fc73610148f5","resolution":{"observed_at":"2026-08-07T11:33:54.702600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T11:33:55.000411Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.000411Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:dcaba50e72c7248d226afc7277fb7d0dc26a1ec412266b6b06479ec4395eb4aa","observation_id":"04d656e2-c62d-4612-92f6-7b1e770b01bd","resolution":{"observed_at":"2026-08-07T11:33:55.000411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:33:55.145743Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.145743Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:71e1dacbccd3854c69caa7021d47a8369e9aae79d8e36ad6a91f31c3fd6abf97","observation_id":"c30c30e7-a2a5-40f5-aa80-9eade33d7799","resolution":{"observed_at":"2026-08-07T11:33:55.145743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12146","last_updated":"2024-05-31T03:25:42Z","snapshot_observed_at":"2026-07-31T17:39:49.477346Z","submitted_at":"2024-02-19T13:57:55Z","title":"Enabling Weak LLMs to Judge Response Reliability via Meta Ranking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12146","snapshot_observed_at":"2026-08-07T11:33:55.280113Z","title":"Enabling weak llms to judge response reliability via meta ranking.arXiv preprint arXiv:2402.12146,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.280113Z"},"links":{"cited_paper":"/paper/2402.12146","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:eeb5a9705a613e7ae7f44d84ce248c248addb816b3041293b49e5c7eb22bae7c","observation_id":"0f96e0ce-7823-441d-bc85-09fc21a62170","resolution":{"observed_at":"2026-08-07T11:33:55.280113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T11:33:55.416178Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.416178Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:edaa0fed042f4402c1048e02e2c1952a885622fc68eeecc04e9d40d0a3bc8175","observation_id":"281fdffb-7daf-4088-a06d-b603cad1e1f9","resolution":{"observed_at":"2026-08-07T11:33:55.416178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18252","last_updated":"2025-04-26T08:33:32Z","snapshot_observed_at":"2026-08-07T20:55:15.330079Z","submitted_at":"2024-10-23T19:59:50Z","title":"Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18252","snapshot_observed_at":"2026-08-07T11:33:55.521985Z","title":"Asynchronous rlhf: Faster and more efficient off-policy rl for language models.arXiv preprint arXiv:2410.18252,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.521985Z"},"links":{"cited_paper":"/paper/2410.18252","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:0da5553629091c02d05c024e6443ded27e04c867c0104370ef33f07500bf7e14","observation_id":"6d8283ee-dc53-42bc-bf0b-7e40a6c8fb88","resolution":{"observed_at":"2026-08-07T11:33:55.521985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:33:55.643161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.643161Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:1b87f7db8a5874bd1a37b56c070aa20c286c49cdfd385b267429def81b9bc2c6","observation_id":"8325e58a-b228-4603-8f90-fa9d1df8c754","resolution":{"observed_at":"2026-08-07T11:33:55.643161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:33:55.813166Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.813166Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:d09d356493f4aa4866bbcf008b3cb4ec88eda44f3fdaed862faa1361e5696816","observation_id":"58fd25b9-d2f3-4476-98de-d4e90c16c08c","resolution":{"observed_at":"2026-08-07T11:33:55.813166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T11:33:55.929448Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:55.929448Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:5e8982d36e4b5e91f7a175ffc0eb6c02de27a819f9a5a1572ccb7024ff8c7aa2","observation_id":"10a3f3e9-9bb3-4dc5-aaa8-8ef6b83ed13e","resolution":{"observed_at":"2026-08-07T11:33:55.929448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:33:56.042626Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.042626Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:25a2e08bce5d89c554a863d3b25adef6cc92992c2daab69b7f6dbfbea59e963d","observation_id":"8bb4b8c2-2e6a-4fec-8a11-2d49ab3cd961","resolution":{"observed_at":"2026-08-07T11:33:56.042626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-07T16:02:06.428060Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T11:33:56.370913Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.370913Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:635432fd60507257c10bb13c19095a35014d8750131fada29a0cd214c1dcb8bf","observation_id":"b7f103ad-20e3-4ede-b2fb-bba1a62b64ea","resolution":{"observed_at":"2026-08-07T11:33:56.370913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-07T11:33:56.534466Z","title":"Not all rollouts are useful: Down-sampling rollouts in llm reinforcement learning.arXiv preprint arXiv:2504.13818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.534466Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:58bf3d42e5f6599d00f78a4c063923262018fb3b585e4e7407bc37db4593424b","observation_id":"f678aa86-9893-4cd6-8d94-f0914b3a7036","resolution":{"observed_at":"2026-08-07T11:33:56.534466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T11:33:56.659506Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.659506Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:6808e02ca3c6dddb154e42c9c06f690321137efe8eb44bddd06eb154cde32baf","observation_id":"87883627-e99d-41f5-b282-cc9822319cae","resolution":{"observed_at":"2026-08-07T11:33:56.659506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T11:33:56.783335Z","title":"Limo: Less is more for reasoning.arXiv preprint arXiv:2502.03387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.783335Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:e1c984707fa3f31c3eebb4d8047a4fee6c02882a5f2becaa373a52d2598d3762","observation_id":"40fb4ab4-d45f-4e03-adc9-c5a196ab3651","resolution":{"observed_at":"2026-08-07T11:33:56.783335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:33:56.907899Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.907899Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:f089f0b2abb397ade50593432d7072007598522138307ad976ec0d3c547f1f7e","observation_id":"209e468b-62bb-4f5a-b75b-ea1eb0702bd0","resolution":{"observed_at":"2026-08-07T11:33:56.907899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T11:33:57.031251Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.031251Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:431ac3a98e9711e96f049f16f38e0b9318976bc40ae9b5647117b30c27f176cf","observation_id":"1871f2f7-c535-4ef7-9dcc-a2ad22c02ed6","resolution":{"observed_at":"2026-08-07T11:33:57.031251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-08-09T04:45:02.412245Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-08-07T11:33:57.154091Z","title":"Xiaotian Zhang, Chunyang Li, Yi Zong, Zhengyu Ying, Liang He, and Xipeng Qiu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.154091Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:6a29a8df7116b7b812960d6a96f4563ecce791a0296c086064933743771dbd43","observation_id":"0550c118-947f-459e-bfbe-4a6c265c01e0","resolution":{"observed_at":"2026-08-07T11:33:57.154091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-07T11:33:57.305024Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.305024Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:044fab58066bae451a4807e9b978b3111b5922c5b51bab572296513ce0699b67","observation_id":"af96af09-a3de-4845-a58d-785ada5276b4","resolution":{"observed_at":"2026-08-07T11:33:57.305024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:00.769945Z","title":"Coverage-centric coreset selection for high pruning rates","venue":null,"work_id":"a1fedb21-a16d-4509-8359-9f8ed6cb00ca","year":2023},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.447663Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:328532ba449f88fca15e96062d92f859f17371752a01664481d217aa25ad4c82","observation_id":"39da3963-895b-4fa0-9746-a8b686108307","resolution":{"observed_at":"2026-08-07T11:34:00.880737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:00.509592Z","title":"LLNL-affiliated authors were supported under Contract DE-AC52-07NA27344 and supported by the LLNL-LDRD Program under Project Nos","venue":null,"work_id":"927649a6-8379-4e98-bf3f-21de3c2c1320","year":2024},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.550465Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:fe224ca09b13f9048ff6dd9c4750a97621e55bd64ad39ef6756ab392e4950740","observation_id":"b4b7d512-6da2-4e00-a08b-ae0adce931fb","resolution":{"observed_at":"2026-08-07T11:34:00.655878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:34:00.260004Z","title":"We find that training on DAPO alone can degrade performance on LaTeX-based benchmarks, so we augment it with MATH to preserve formatting diversity and improve generalization","venue":null,"work_id":"afafb738-107f-4ec5-8935-45ddb336fbd5","year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.673181Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:e80abc6972aba351660c2c4c5ca4eaf29c0332bbfe5ce23890c46a986e73771b","observation_id":"9d4a53b0-6123-428b-ad5b-49517ad0fe3a","resolution":{"observed_at":"2026-08-07T11:34:00.370119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.737683Z","title":"We use 4xH100 for Qwen2.5-Math-1.5B training and 8xH100 for Qwen2.5-Math-7B and DeepSeek-R1-Distill-Qwen-1.5B","venue":null,"work_id":"be2f9371-1391-4920-a906-318b75ea9bd2","year":2023},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:57.964485Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:34eba32a60f496748859558e29f12f53521f294971b2818db512eb3742b2e98a","observation_id":"97e561c9-9c20-4a84-abea-f46fe94f1050","resolution":{"observed_at":"2026-08-07T11:33:59.873088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.254776Z","title":null,"venue":null,"work_id":"d8237337-0584-46b7-b377-1689f1436bff","year":2021},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:58.212664Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:d2926a1df48dad59ab5a3bb8552dda63f83e00df65786cbd0f352f8d7b90077e","observation_id":"7eafab92-670f-4b36-bd34-28395fb1569c","resolution":{"observed_at":"2026-08-07T11:33:59.357792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-07T11:33:53.510451Z","title":"Safe rlhf: Safe reinforcement learning from human feedback.arXiv preprint arXiv:2310.12773,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.510451Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:3c3a12c18082bf2bd32e0ed7efe0f3536f9adfc0d6d265941b34ddeb66f77f57","observation_id":"64209bf2-bcdd-4765-acb2-35b1ea20ce8e","resolution":{"observed_at":"2026-08-07T11:33:53.510451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.459990Z","title":"We use β1 = 0.9, β2 = 0.999, and apply a weight decay of 0.01","venue":null,"work_id":"8f7c4451-39c7-4bd3-9106-26f676ac9066","year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:58.080472Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:4beeeb8f5626bd27df71f0897a7df503eaa060ac36355f0dd0276839d35dbe53","observation_id":"8efec914-804d-416f-bbd1-df6fdc0ad840","resolution":{"observed_at":"2026-08-07T11:33:59.602692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T11:33:56.204875Z","title":"Reinforcement learning for reasoning in large language models with one training example.arXiv preprint arXiv:2504.20571,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.204875Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:9fa6219db80cab4897d8789dd465f81f06241ea0551219cab12e8e4678aa7e02","observation_id":"2a05e5e0-9c29-4444-89dd-426e927ce2b7","resolution":{"observed_at":"2026-08-07T11:33:56.204875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T11:33:54.297876Z","title":"Reinforce++: A simple and efficient approach for aligning large language models.arXiv preprint arXiv:2501.03262,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.297876Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:c92a3dd1ff38091a37d87c632153f59a2c301d7b5d340f7cd005b5fa3309532c","observation_id":"078a963e-511f-47f7-90a5-90629883b038","resolution":{"observed_at":"2026-08-07T11:33:54.297876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T11:33:54.876617Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.876617Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:5012946804e13b3aa4146339de0d9233bfe0ffd679d5d10a4488a7d4e1632c44","observation_id":"5c790190-4f4c-4b4f-a4a2-43d7f28d5c46","resolution":{"observed_at":"2026-08-07T11:33:54.876617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10500","last_updated":"2025-06-07T16:03:51Z","snapshot_observed_at":"2026-08-09T23:56:03.049175Z","submitted_at":"2024-02-16T08:19:34Z","title":"Active Preference Optimization for Sample Efficient RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10500","snapshot_observed_at":"2026-08-07T11:33:53.628034Z","title":"Active preference optimization for sample efficient rlhf.arXiv preprint arXiv:2402.10500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.628034Z"},"links":{"cited_paper":"/paper/2402.10500","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:8713ca376fedc555c2b1fc90df0e7b9169eda375458313f20bd0a953105be189","observation_id":"5182579f-4527-4fea-820f-fafc04ade777","resolution":{"observed_at":"2026-08-07T11:33:53.628034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:33:53.786117Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.786117Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:d30ae1a7c2b22dca7aebddec51419be1c9bff76e1f0aa5d91a4d29b31d14b374","observation_id":"de08b487-e30d-48b1-90f0-2e748fca46e8","resolution":{"observed_at":"2026-08-07T11:33:53.786117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:53.916913Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025.https://github.com/huggingface/open-r1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:53.916913Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:81569273d062f7bd0d1e64df437f042d8f3f50f5e047b00192cbaeb0b20f142e","observation_id":"d5eb21f6-e440-4230-a022-5f7f5ebe07d1","resolution":{"observed_at":"2026-08-07T11:33:53.916913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:33:59.021866Z","title":"We evaluate all models with temperature = 1 and repeat the test set 4 times for evaluation stability, i.e.,pass@1(avg@4), for all benchmarks","venue":null,"work_id":"74e1b636-d475-4215-bb96-406f9cfb250e","year":2025},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":8196,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:58.345391Z"},"links":{"citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:0de16983285cd9f657984c3e38f6ef97c82876065e1905e406a715aa3f193ecf","observation_id":"9d935f1b-5438-49e7-a02b-8e5183d840bb","resolution":{"observed_at":"2026-08-07T11:33:59.131928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 28 inbound Pith citation observations for arXiv:2506.02177."}