{"as_of":"2026-08-13T08:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e4ceb1ca118337ea8de53b46946aa1a437b7733e9205b69535c7a32ae9c00aa","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:21:08.269218Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:16.232644Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:08.457909Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-05T22:03:28.124820Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.124820Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:c1d4cb35dd487af0b1053f730938491dd99a947962e2b579aec0cf073fa49af2","observation_id":"c40f1373-96d7-47d6-bf88-a85fa7fb7c7d","resolution":{"observed_at":"2026-08-05T22:03:28.124820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c5427295cc3f6af45b64a53f354f33bcbe5006ecd92e16dc5f4ec188e227636e","observation_id":"799af097-4862-4a75-989d-849b0b503152","resolution":{"observed_at":"2026-05-18T19:21:48.591192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T22:59:14.473018Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models.arXiv preprint arXiv:2508.10751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.473018Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:0f5cd8e17880d9265f06ff21432bd9b1e6e3151ca887bc4eae7d45e31feee1ec","observation_id":"d36f566e-f01d-46dc-9179-90ccd70433a4","resolution":{"observed_at":"2026-08-04T22:59:14.473018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:2f1cbc7a30f57ed9964a05f1e28aff3b55e88e1838b7848426c7b9991d306202","observation_id":"45b8b181-2879-4fdd-9eca-4e0f414cdbfa","resolution":{"observed_at":"2026-05-18T00:02:25.160513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2509.23629","last_updated":"2026-05-07T02:29:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T04:10:37Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-18T12:43:49.628082Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.23629"},"observation_digest":"sha256:188b3c53427ffc3786ebbf379597512c27fe86f339ea57cdf52dee779ec43d48","observation_id":"88eb6109-4516-431f-a947-b6785bebb238","resolution":{"observed_at":"2026-05-18T12:46:24.288452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T11:33:56.981364Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.04140","last_updated":"2026-07-01T03:04:05Z","snapshot_observed_at":"2026-08-09T08:40:58.371980Z","submitted_at":"2025-10-05T10:38:55Z","title":"Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T11:33:56.981364Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2510.04140"},"observation_digest":"sha256:67479464107f1d567d5080ad08c4e22e0aa145fcd8b9d90f1bc50949bfa66d72","observation_id":"191f6cdb-d00d-4350-822a-e95904af13b6","resolution":{"observed_at":"2026-08-04T11:33:56.981364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T09:34:06.058912Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-06T05:26:40.214370Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T09:34:06.058912Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2510.14807"},"observation_digest":"sha256:4bd3912c283d8452005f7f12f960f81b2d522d9d51286def3925f8a6b380b2ea","observation_id":"ce897c27-c9b9-450c-adff-e09bdc6df006","resolution":{"observed_at":"2026-08-04T09:34:06.058912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2602.06475","last_updated":"2026-05-13T09:12:10Z","snapshot_observed_at":"2026-08-11T00:44:08.199717Z","submitted_at":"2026-02-06T08:03:11Z","title":"Towards Generalizable Reasoning: Group Causal Counterfactual Policy Optimization for LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T07:21:01.335414Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2602.06475"},"observation_digest":"sha256:1efd47d5bd81c8ebfc2fb25621eb8c9bd3ef99853dd50f28c5c3cd2c0a60313a","observation_id":"f0672f5f-5a20-4c0a-a0c0-18135e3042d1","resolution":{"observed_at":"2026-05-16T07:22:31.160267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-02T20:44:43.950446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22642","last_updated":"2026-06-18T19:10:56Z","snapshot_observed_at":"2026-08-12T17:05:29.500530Z","submitted_at":"2026-02-26T05:47:30Z","title":"Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:44:43.950446Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2602.22642"},"observation_digest":"sha256:0eec76155728393155a44651ceafede793654af323a2cb2f721b1c6843d58f63","observation_id":"365887bf-2e01-45cf-b80d-f1c14d8774aa","resolution":{"observed_at":"2026-08-02T20:44:43.950446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2604.14142","last_updated":"2026-04-15T17:59:01Z","snapshot_observed_at":"2026-08-11T21:11:54.456177Z","submitted_at":"2026-04-15T17:59:01Z","title":"From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T12:50:57.603403Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2604.14142"},"observation_digest":"sha256:72b65ace65d8963a82b7d294d57e27542919da52c38b7df0d78496ed1e72521b","observation_id":"ad4def12-7ced-403f-bfb8-dd4bfafe21ec","resolution":{"observed_at":"2026-05-11T11:41:03.928079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2604.16972","last_updated":"2026-04-18T11:43:08Z","snapshot_observed_at":"2026-08-12T20:04:42.355033Z","submitted_at":"2026-04-18T11:43:08Z","title":"MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T07:05:45.081955Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2604.16972"},"observation_digest":"sha256:aa207fa7570115b71e440098afefa6c808b7d86f4680f7d085e45ab45be613d8","observation_id":"493c6899-d3c8-491a-8f31-7eff9bddad66","resolution":{"observed_at":"2026-05-10T07:06:52.810362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2604.16995","last_updated":"2026-04-18T13:49:47Z","snapshot_observed_at":"2026-07-06T23:04:10.324443Z","submitted_at":"2026-04-18T13:49:47Z","title":"SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T06:57:03.100519Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2604.16995"},"observation_digest":"sha256:3c8abf6ee256c89130d61654f40044eddf6299fba069097d457513b46ed628fa","observation_id":"ffb3f9a7-bae6-4387-a39d-f03a74925aa4","resolution":{"observed_at":"2026-05-10T07:01:49.470700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:ff645b33030d5d9e2744a3ed51f563f75348e30b8fe25d9869b5af2849f6c186","observation_id":"6f9a438e-d767-480b-9e90-66e45d68f524","resolution":{"observed_at":"2026-05-11T15:26:15.655822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-12T18:27:15.382806Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-09T19:26:57.596581Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:f19f8c4defa85e226a474d7ba80bf3ac12c1bebba228be1d860b99990817d8b6","observation_id":"3a3e0fe9-f636-46dd-a3e8-249b9504625c","resolution":{"observed_at":"2026-05-11T15:41:46.295094Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-12T18:27:15.382806Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:42e6cdbc75fc355a73a51378b5d9be4e35d0e2a271e803d229af215fac77c590","observation_id":"51162d63-f47d-4295-aad7-d13027ce7f2f","resolution":{"observed_at":"2026-05-11T03:55:56.520021Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.06523","last_updated":"2026-05-07T16:30:28Z","snapshot_observed_at":"2026-08-11T13:02:42.119350Z","submitted_at":"2026-05-07T16:30:28Z","title":"On the Implicit Reward Overfitting and the Low-rank Dynamics in RLVR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T12:40:53.063991Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.06523"},"observation_digest":"sha256:83e26e1c077d969c09df866df0421e4641f99d10229083f9a03c7f7e405f880b","observation_id":"1b4bac14-8d4b-4e1b-99f9-62665a56480d","resolution":{"observed_at":"2026-05-11T19:06:10.050125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.07039","last_updated":"2026-05-07T23:38:50Z","snapshot_observed_at":"2026-08-02T16:36:23.528400Z","submitted_at":"2026-05-07T23:38:50Z","title":"PACEvolve++: Improving Test-time Learning for Evolutionary Search Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T00:54:39.349292Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.07039"},"observation_digest":"sha256:f6c91cb28ee20b04719ab981c139da7a80947a20497114c191ff215374cd0886","observation_id":"daa2a35e-d39a-4ae5-b48f-d4d49bffec98","resolution":{"observed_at":"2026-05-11T05:00:56.299422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.08817","last_updated":"2026-05-09T09:10:03Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T09:10:03Z","title":"How You Begin is How You Reason: Driving Exploration in RLVR via Prefix-Tuned Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T03:25:04.955816Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.08817"},"observation_digest":"sha256:604d0ac20c096bc56e3b0055ea6e62cda4b21ebe9bb2905574ecafa4bcc959c8","observation_id":"b2396714-c593-4147-b06c-da2776362bf8","resolution":{"observed_at":"2026-05-12T03:26:19.271730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-08-10T22:18:32.678886Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:9683c819976e728eaabfa4ccc3ec4d4361c15e138ec146e5be524adebee2d716","observation_id":"a6579577-05d4-4a44-a098-bf48c50f0bf6","resolution":{"observed_at":"2026-05-12T04:21:22.408581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:57:30.877915Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:82fed09d4663e2455c432fb8b89abc2196935b8006c7b6107eb24625f1591f1c","observation_id":"ed419b70-ffc5-4eae-bf39-c060302b0ee9","resolution":{"observed_at":"2026-05-13T02:07:09.183624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.11461","last_updated":"2026-05-18T07:36:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T03:20:24Z","title":"Breaking $\\textit{Winner-Takes-All}$: Cooperative Policy Optimization Improves Diverse LLM Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T22:45:56.857810Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.11461"},"observation_digest":"sha256:3cddf7d1ae024bfa0d99207c658a218167332cf74da70c808c560f84fea2b038","observation_id":"4efd0409-3d61-4fff-90f7-0358f16c0b19","resolution":{"observed_at":"2026-05-20T22:49:10.563663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.18864","last_updated":"2026-05-15T07:42:21Z","snapshot_observed_at":"2026-07-06T23:29:42.583875Z","submitted_at":"2026-05-15T07:42:21Z","title":"SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-20T20:09:42.841695Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.18864"},"observation_digest":"sha256:a052741d4b42e2a86350c6989f62b3966397c8c78c6f234b3bd82bc37dd363af","observation_id":"9a1a4a03-0132-4c2f-b4ba-3a3c836b1e46","resolution":{"observed_at":"2026-05-20T20:13:44.104548Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.19461","last_updated":"2026-05-19T07:13:00Z","snapshot_observed_at":"2026-08-02T05:41:38.392967Z","submitted_at":"2026-05-19T07:13:00Z","title":"Beyond Mode Collapse: Distribution Matching for Diverse Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:30:37.685873Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.19461"},"observation_digest":"sha256:3698c8569f2c368e19adc71b6982768b67b2ba3a38b72a188515421140a97800","observation_id":"f26dcbd3-d925-49b1-91fb-13e1c3be1936","resolution":{"observed_at":"2026-05-20T05:33:04.068835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.20854","last_updated":"2026-05-30T15:59:38Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:43Z","title":"Finite-Time Regret Analysis of Retry-Aware Bandits","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T06:01:17.988127Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.20854"},"observation_digest":"sha256:e5e3cc6ccc9ac0617afe8871c5481e3c108616727f4b69a59906b3730c071f78","observation_id":"dfe95361-ed25-42cd-8246-efab17eaac41","resolution":{"observed_at":"2026-05-21T06:03:59.249766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.20854","last_updated":"2026-05-30T15:59:38Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:43Z","title":"Finite-Time Regret Analysis of Retry-Aware Bandits","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:02.539675Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.20854"},"observation_digest":"sha256:6d25a6c5d92620c3beca301327c92b0617a9acf9531facbc4e6676593a0d5479","observation_id":"f35f1a59-919b-493e-b88b-69a2bfa9def1","resolution":{"observed_at":"2026-06-30T17:34:57.515573Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.20865","last_updated":"2026-05-20T08:01:01Z","snapshot_observed_at":"2026-08-12T12:03:15.752168Z","submitted_at":"2026-05-20T08:01:01Z","title":"Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T05:55:45.654673Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.20865"},"observation_digest":"sha256:61db27ebd3aa1e781c2248bddd2c3085183071e3e81256e302031b78548118d0","observation_id":"42e13782-b429-419b-8dc1-0dce22bdd636","resolution":{"observed_at":"2026-05-21T05:59:41.116576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.21792","last_updated":"2026-05-20T22:36:11Z","snapshot_observed_at":"2026-08-03T03:37:10.269280Z","submitted_at":"2026-05-20T22:36:11Z","title":"Residual Skill Optimization for Text-to-SQL Ensembles","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T08:38:41.126772Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.21792"},"observation_digest":"sha256:8b5dacd7ebf220fe5e6509948431aaa194a3d922953f4449170732808440da75","observation_id":"97047d31-dc3f-44fd-ad7c-ac45de92f9ca","resolution":{"observed_at":"2026-05-22T08:41:17.254306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.29303","last_updated":"2026-05-28T03:36:05Z","snapshot_observed_at":"2026-08-02T10:09:28.694342Z","submitted_at":"2026-05-28T03:36:05Z","title":"Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T08:01:39.412431Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.29303"},"observation_digest":"sha256:c70ce20be12f6eca4aa41e723ae3200b81aa59bf5f34125f9a53e5364d59d06a","observation_id":"f655d136-4f42-443e-b1fa-a80c77dff8a4","resolution":{"observed_at":"2026-06-29T08:03:13.949295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.03608","last_updated":"2026-06-02T13:11:09Z","snapshot_observed_at":"2026-08-07T00:11:41.078023Z","submitted_at":"2026-06-02T13:11:09Z","title":"Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T10:53:00.223228Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.03608"},"observation_digest":"sha256:7defb40ed1dad9def855a32a4d5258df48f305bee55b4d156e0d33da12929155","observation_id":"fc4b7227-bd3d-41aa-811f-d456642b1cf9","resolution":{"observed_at":"2026-07-02T02:26:27.306210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.05888","last_updated":"2026-06-04T08:57:45Z","snapshot_observed_at":"2026-08-09T12:01:33.602409Z","submitted_at":"2026-06-04T08:57:45Z","title":"Retry Policy Gradients in Continuous Action Spaces","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T01:44:37.492572Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.05888"},"observation_digest":"sha256:3e3742dd9bac7b0695aed95685e29eee9a791e384a2df9e0ad78a44e8c80b39a","observation_id":"19363c93-9a7d-400c-9e42-7115da93686e","resolution":{"observed_at":"2026-07-02T12:56:57.024097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:ee5290738c7488b3ddc1d83b276cbf434acbb290617aabfffccae3600faaa125","observation_id":"b02f5bbd-79a9-4cf7-8857-b3f6bccb225e","resolution":{"observed_at":"2026-07-02T12:06:56.383237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-08-13T00:39:41.357427Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:d64274fb5642417e06d22e554e3d7dc385007ac1180139126b93b651e5f1086e","observation_id":"742e7457-58dc-4252-90bd-f8328b9c11b5","resolution":{"observed_at":"2026-07-02T12:16:56.976361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.18487","last_updated":"2026-06-22T09:16:48Z","snapshot_observed_at":"2026-08-05T23:38:39.942175Z","submitted_at":"2026-06-16T20:59:55Z","title":"SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T01:15:18.237335Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.18487"},"observation_digest":"sha256:1ff44bdaa1ff8efe48ea66b3a1e7760876d3299a9aa7ced3c93ec6a576042353","observation_id":"eeba6203-dd94-4814-ae96-c7756f3bf42c","resolution":{"observed_at":"2026-07-03T20:38:55.621080Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.18910","last_updated":"2026-06-17T10:37:23Z","snapshot_observed_at":"2026-08-02T21:25:42.997753Z","submitted_at":"2026-06-17T10:37:23Z","title":"REVES: REvision and VErification--Augmented Training for Test-Time Scaling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:15.337979Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.18910"},"observation_digest":"sha256:ec1cd34187ad697609770d6dc04d6fe164ba2b55ce37378a832aeb97b639a3b8","observation_id":"31da5b42-3f07-437e-aab9-7e9d4d976486","resolution":{"observed_at":"2026-07-04T00:19:14.053289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.21090","last_updated":"2026-06-17T18:03:06Z","snapshot_observed_at":"2026-07-30T06:23:05.041940Z","submitted_at":"2026-06-17T18:03:06Z","title":"Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T21:07:28.660119Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.21090"},"observation_digest":"sha256:77946ada006c9965816ff9552b611e5c1813cf690975fdd44beb889f1011cedf","observation_id":"a43c264f-4835-47fe-934d-7d24b231d5d5","resolution":{"observed_at":"2026-07-04T00:29:16.717650Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-10T18:32:18.583804Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:5d798a323a0ea50db03d3b673beb11909b1d1b4e0ff2acf53a43e95d91bbf15a","observation_id":"daa031ff-e73d-4e70-88eb-e64ef10d3383","resolution":{"observed_at":"2026-07-04T21:00:08.459905Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2607.01490","last_updated":"2026-07-01T21:39:19Z","snapshot_observed_at":"2026-08-13T03:52:17.032614Z","submitted_at":"2026-07-01T21:39:19Z","title":"Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-03T20:59:57.539909Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.01490"},"observation_digest":"sha256:d72375d03ac6f5cf222e4396600d9b65f2bdc456483554d6fe96e2955d2a8e96","observation_id":"c3aac177-1822-4da3-9390-aeb872f3e1f0","resolution":{"observed_at":"2026-07-03T21:08:57.650057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2607.02390","last_updated":"2026-07-02T16:25:10Z","snapshot_observed_at":"2026-08-03T00:49:51.748486Z","submitted_at":"2026-07-02T16:25:10Z","title":"DecompRL: Solving Harder Problems by Learning Modular Code Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-03T16:30:34.793328Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.02390"},"observation_digest":"sha256:7b8d4e5b6db3e9e92a7ad612f3ed4dec0f0591e25a274f6227c030eae8ec6df6","observation_id":"65a40f4f-3a54-45ee-94f8-cb0002af75a6","resolution":{"observed_at":"2026-07-03T16:38:39.768877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-12T05:08:55.438431Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models.arXiv preprint arXiv:2508.10751, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03065","last_updated":"2026-07-03T07:57:31Z","snapshot_observed_at":"2026-08-13T02:14:55.714181Z","submitted_at":"2026-07-03T07:57:31Z","title":"Spectral Rewiring for Exploration, Purification, and Model Merging","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T05:08:55.438431Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.03065"},"observation_digest":"sha256:7041e7faf2573770316fce5893e9eb59e6f14671c39d56c02dc6c964a252d5c9","observation_id":"735e13ff-2756-48e3-88b5-344b01ad6948","resolution":{"observed_at":"2026-07-12T05:08:55.438431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-02T06:37:36.599379Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.12395","last_updated":"2026-07-16T03:43:34Z","snapshot_observed_at":"2026-08-13T01:53:28.784655Z","submitted_at":"2026-07-14T06:14:55Z","title":"Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T06:37:36.599379Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.12395"},"observation_digest":"sha256:37aeb54ded64ad48e14d93c2ba7b65abbf067590c4ebc06945aa108e8819ff65","observation_id":"11a1f182-415f-45d8-a3ec-9b9c8e7a7bd0","resolution":{"observed_at":"2026-08-02T06:37:36.599379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-01T08:41:09.320896Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models.arXiv preprint arXiv:2508.10751, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27372","last_updated":"2026-07-29T18:25:17Z","snapshot_observed_at":"2026-08-08T11:48:16.614235Z","submitted_at":"2026-07-29T18:25:17Z","title":"Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T08:41:09.320896Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2607.27372"},"observation_digest":"sha256:7ab530d694cb6bbe4cabe733d02bd62f5024320ea96f041994c5f4b02ab70190","observation_id":"f3e1b247-a286-4779-8f1e-f44820c54e7c","resolution":{"observed_at":"2026-08-01T08:41:09.320896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-05T00:54:52.387697Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00494","last_updated":"2026-08-01T07:35:06Z","snapshot_observed_at":"2026-08-09T10:47:03.569637Z","submitted_at":"2026-08-01T07:35:06Z","title":"TaPR: Test-Aware Policy Refinement for Feedback-Conditioned Code Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T00:54:52.387697Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2608.00494"},"observation_digest":"sha256:a002929655b5a5f6bbb3a11b1300ee907bbc57c0abe52d5e0255c4e889e06f7a","observation_id":"53d17f62-7644-4900-8a92-e26913548d27","resolution":{"observed_at":"2026-08-05T00:54:52.387697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T15:25:49.330187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-13T06:37:05.498656Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T15:25:49.330187Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:f25752efefa2d09af7c8935a55d93b10925a581bab4720839b41f8ce14510c2d","observation_id":"1f503e5d-6900-4a9f-9df7-401fa10d48df","resolution":{"observed_at":"2026-08-04T15:25:49.330187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-07T00:15:16.232644Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-13T06:37:05.498656Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:16.232644Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:9be184b7aceb4acacd4c8739762728a454a76ce4e820e7fc3f957e92f63130cd","observation_id":"9cc2c55c-b733-40bf-aafc-e98d3ce6213e","resolution":{"observed_at":"2026-08-07T00:15:16.232644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-04T13:44:40.174330Z","title":"arXiv preprint arXiv:2508.10751 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02149","last_updated":"2026-08-03T12:34:04Z","snapshot_observed_at":"2026-08-13T06:02:04.863233Z","submitted_at":"2026-08-03T12:34:04Z","title":"Beyond the Mean: Multi-Moment Policy Optimization for LLM Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T13:44:40.174330Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2608.02149"},"observation_digest":"sha256:0f5ad5808632f952aa448202e2df1a755ae0d791c155cd8a1c77cf5aa6ed4205","observation_id":"53186b75-65a6-4686-bc35-4da457bbb35e","resolution":{"observed_at":"2026-08-04T13:44:40.174330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10751/citation-record","integrity":"/paper/2508.10751/integrity","json":"/paper/2508.10751/citation-record.json","paper":"/paper/2508.10751"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-05T20:21:04.023052Z","title":"L1: controlling how long A reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.023052Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:8f7f41cb91ca714922c5a65ae523cec0c357b2a95769d7bcb8c11e352cd436fb","observation_id":"20fe78a0-c3b7-4dba-9e54-00d8c30a84d5","resolution":{"observed_at":"2026-08-05T20:21:04.023052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.634295Z","title":"Aime2024, 2024","venue":null,"work_id":"50959846-e8cb-4520-bf2a-e9d1a2c6963a","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.149401Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:f0a36ecbd253f46b14648e3802e6f4a2e95511a7e291aacadb9cc01964c38b39","observation_id":"e4f65368-aa33-417e-a8cc-39db8d830f48","resolution":{"observed_at":"2026-08-05T20:21:09.639070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.619073Z","title":"Aime2025, 2025","venue":null,"work_id":"45585717-7112-4533-b2db-1ce9784e0c81","year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.271095Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:ec874cde234f6deec0fa10eb999fd9a1a244355615730bb97adf79676ebace82","observation_id":"311c3a56-09ae-41db-bcc8-c81911226bee","resolution":{"observed_at":"2026-08-05T20:21:09.624512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-07T00:59:44.889602Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-05T20:21:04.419668Z","title":"A survey of exploration methods in reinforcement learning.CoRR, abs/2109.00157, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.419668Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:77728576e4cd157a40d4a88ac1211911999943487dd87d56510474ecce614c76","observation_id":"62f72c5a-6235-4654-bc26-fe632c7dce51","resolution":{"observed_at":"2026-08-05T20:21:04.419668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T20:21:04.577447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.577447Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:7bfae7199fcc96339389ae2a8bece7c48a059b73a11997b049553aa462eb56f0","observation_id":"e7c1322f-379a-4b7f-a5f3-bdd4942d70a7","resolution":{"observed_at":"2026-08-05T20:21:04.577447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.603694Z","title":null,"venue":null,"work_id":"b3c72ddc-a01c-4e91-8054-11e9279f715b","year":2023},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.749033Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:1b20c9ecb63301053aefcc9435753e3fcec16215b90503c231e2561377b63d3b","observation_id":"3343a24b-c34c-4c73-b8dd-5dcf52e709bf","resolution":{"observed_at":"2026-08-05T20:21:09.609052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19914","last_updated":"2025-06-09T07:49:32Z","snapshot_observed_at":"2026-08-07T16:09:17.796555Z","submitted_at":"2025-05-26T12:40:31Z","title":"Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19914","snapshot_observed_at":"2026-08-05T20:21:04.915607Z","title":"Enigmata: Scaling logical reasoning in large language models with synthetic verifiable puzzles.CoRR, abs/2505.19914, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:04.915607Z"},"links":{"cited_paper":"/paper/2505.19914","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:95bbf93be3eeb8652ff12095ffc6433e42e6124245d1a1ae8752db3b2375af8b","observation_id":"fd4291e8-8156-4eed-a22b-59ee16b57e10","resolution":{"observed_at":"2026-08-05T20:21:04.915607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.589052Z","title":"Improving large language models via fine-grained reinforcement learning with minimum editing constraint","venue":null,"work_id":"e1b30db2-72ac-414b-b38e-b0692b22cabd","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.110565Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:4ea739164401fc6b58cd4388fbf3627628f3e03342cb16203cb247d846ceb689","observation_id":"42cc8885-3790-443d-b3e1-dab8a68371a9","resolution":{"observed_at":"2026-08-05T20:21:09.593888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04548","last_updated":"2025-03-06T15:34:27Z","snapshot_observed_at":"2026-08-12T07:19:37.848854Z","submitted_at":"2025-03-06T15:34:27Z","title":"An Empirical Study on Eliciting and Improving R1-like Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04548","snapshot_observed_at":"2026-08-05T20:21:05.350521Z","title":"An empirical study on eliciting and improving r1-like reasoning models.CoRR, abs/2503.04548, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.350521Z"},"links":{"cited_paper":"/paper/2503.04548","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:6a2ea0545f53cd53e1122b94f4a7324ac35706b21749c4b34efa580d30b7913e","observation_id":"9a097a0b-09ff-4ebf-8733-eafab4a5893d","resolution":{"observed_at":"2026-08-05T20:21:05.350521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T20:21:05.510301Z","title":"Reasoning with exploration: An entropy perspective.CoRR, abs/2506.14758, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.510301Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:81d7c1e05269417c40bfea70dd60c389d0f6ec989932ad19527b354a099ce4b2","observation_id":"99805c56-6e20-4578-aacb-2b4bb2e1fcf4","resolution":{"observed_at":"2026-08-05T20:21:05.510301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:05.724526Z","title":"Thinker: Learning to think fast and slow.CoRR, abs/2505.21097, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.724526Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:46885e2b27874e9a3a7b68cb30cb94b49e3d6979a76ab45ee261b4a0ffbfd2d8","observation_id":"b7a6e9fb-9cdc-4e8f-81d3-5e95ae19aa19","resolution":{"observed_at":"2026-08-05T20:21:05.724526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T20:21:05.883163Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.CoRR, abs/2505.22617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:05.883163Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:5b6b5e8b4a41a4ff38e12656abb7aa8c64522aba82f5554e0bf79cd2da69f8bb","observation_id":"1139fa17-a670-4e6a-8954-5c8efaa7a883","resolution":{"observed_at":"2026-08-05T20:21:05.883163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:21:06.013467Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.013467Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:8c473077f58cbf9f3f109a3ebf75234d5a2b8556dd3550bcd5f097fde6f543d9","observation_id":"2d842488-652c-4c9c-8f1b-b8d7477819f7","resolution":{"observed_at":"2026-08-05T20:21:06.013467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T20:21:06.145355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.145355Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:93e98a89c7d48eaf9c86f35f32c6680e373d4b4b041a5ba30a1f7092a830b932","observation_id":"6c23da36-7ce8-4391-813e-3aa311c32bc2","resolution":{"observed_at":"2026-08-05T20:21:06.145355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.574238Z","title":"Stochastic first- and zeroth-order methods for nonconvex stochastic program- ming","venue":null,"work_id":"835912aa-1c43-42c0-bb9d-2e8c6e267ccc","year":2013},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.230165Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:08d158de285de266faf065dab8ba5475b16d04e7418e59a34d1f5f91f71f822c","observation_id":"c0c2e054-71b3-4084-bd1a-8c9069851b83","resolution":{"observed_at":"2026-08-05T20:21:09.579100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.558782Z","title":"Bootstrap resampling methods: something for nothing?The Annals of thoracic surgery, 77(4):1142–1144, 2004","venue":null,"work_id":"26b4309d-bb7f-481a-ad8f-b77c906ff768","year":2004},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.330232Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:81cc48a0cd46ee8a8d9f79e80a2b8e97f345eea74f6549336e2da8ea9df101a2","observation_id":"7084e6e2-2365-41dd-a044-67fafd312f2b","resolution":{"observed_at":"2026-08-05T20:21:09.563898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T20:21:06.466198Z","title":"Seed1.5-vl technical report.CoRR, abs/2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.466198Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:579a386688efd13d7f1fa8936aadaa578f02837ecea020f6ee2ba390b2f081ce","observation_id":"baf71de0-f6fb-4fa1-b7ac-c21f72141e0a","resolution":{"observed_at":"2026-08-05T20:21:06.466198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-08T15:56:07.800611Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-05T20:21:06.606460Z","title":"Skywork open reasoner 1 technical report.CoRR, abs/2505.22312, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.606460Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:0d13e072e4fbbc1f0e77c9c3e941e8ec946058432127f7a9cc9138a8a571a491","observation_id":"628887d4-4e15-42f6-bfb4-b9b8d72704ec","resolution":{"observed_at":"2026-08-05T20:21:06.606460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-05T20:21:06.704021Z","title":"Glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.704021Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:db48036792de8a1a0cea3de8d4604c56b67c85df6cfb10467883049c4885f33c","observation_id":"245b89ef-4157-44b5-b6b4-b08d30903107","resolution":{"observed_at":"2026-08-05T20:21:06.704021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-10T17:58:02.856512Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11651","snapshot_observed_at":"2026-08-05T20:21:06.806080Z","title":"Advancing language model reasoning through reinforcement learning and inference scaling.CoRR, abs/2501.11651, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.806080Z"},"links":{"cited_paper":"/paper/2501.11651","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:ba88ef8fe94f31eaca1fc548d52deabe792568c2f10c2dc41ae56bcfb437e4dd","observation_id":"ac01cefd-0396-434f-892a-51412916c5c1","resolution":{"observed_at":"2026-08-05T20:21:06.806080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T20:21:06.909124Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.CoRR, abs/2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.909124Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:ee202b2d5887214d3618152df952edf8b32db04b61b9d15edcc774c13cfd739a","observation_id":"2e500108-796a-4d7f-aa74-1553e62ba1c5","resolution":{"observed_at":"2026-08-05T20:21:06.909124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20633","last_updated":"2025-05-27T02:18:59Z","snapshot_observed_at":"2026-08-12T22:30:17.043449Z","submitted_at":"2025-05-27T02:18:59Z","title":"Test-Time Learning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20633","snapshot_observed_at":"2026-08-05T20:21:07.016294Z","title":"Test-time learning for large language models.CoRR, abs/2505.20633, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.016294Z"},"links":{"cited_paper":"/paper/2505.20633","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:e442212654ccde126877ab4cfd8d887beee39c6e4c52d95186d35e375e287132","observation_id":"6ee29c13-b5f9-431d-a2c7-d3841c64ad5f","resolution":{"observed_at":"2026-08-05T20:21:07.016294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T20:21:07.122698Z","title":"Openai o1 system card.CoRR, abs/2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.122698Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:e6c1bc65b07fd8ad95d8a45346a53251b2c42febc057899781ad06400ba6be9e","observation_id":"3c53f383-d82f-45cc-81e8-90294d83ced7","resolution":{"observed_at":"2026-08-05T20:21:07.122698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-05T20:21:07.228054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.228054Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:248ad507c6bb6f1d6c9137af94ceee2b60f35e54d4b0df8285710fc688ed8614","observation_id":"b84b9ea5-a56b-42ca-a579-831457015b47","resolution":{"observed_at":"2026-08-05T20:21:07.228054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10406","last_updated":"2025-06-12T06:59:35Z","snapshot_observed_at":"2026-08-08T09:07:12.052492Z","submitted_at":"2025-06-12T06:59:35Z","title":"PAG: Multi-Turn Reinforced LLM Self-Correction with Policy as Generative Verifier","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10406","snapshot_observed_at":"2026-08-05T20:21:07.329389Z","title":"PAG: multi-turn reinforced LLM self-correction with policy as generative verifier.CoRR, abs/2506.10406, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.329389Z"},"links":{"cited_paper":"/paper/2506.10406","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:64ffba56f519808da7354a2cbe21c0fb0c591f90127a2fdfdbd744861fbc63f2","observation_id":"280a78ad-13ba-4915-9c95-3bed5a25b21d","resolution":{"observed_at":"2026-08-05T20:21:07.329389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T20:21:07.431738Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.431738Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:49da7858aac054895494555c30d91888eb0ef092b1f923c7a0c2bc9703e10770","observation_id":"51ff1928-5d33-47cd-8da2-fce57a9ac1d9","resolution":{"observed_at":"2026-08-05T20:21:07.431738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.542122Z","title":"PP-PG: combining parameter perturbation with policy gradient methods for effective and efficient explorations in deep reinforcement learning","venue":null,"work_id":"4fe8d8eb-7873-46fb-a2e1-fd6eb10669b2","year":2021},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.527540Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:985fecad7a768a09f6db4b2c38353bd90eba366544e569c450ce89a33b41c786","observation_id":"7e909de1-669d-4dfc-90ad-4dee4fa37e3b","resolution":{"observed_at":"2026-08-05T20:21:09.548074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T20:21:07.634233Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.CoRR, abs/2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.634233Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:960616fa805ed6e92d3f57bc802600b815679175b39efbef29658c267fefa6b3","observation_id":"de686465-cf53-4b9e-89c3-2a3fdf6af3de","resolution":{"observed_at":"2026-08-05T20:21:07.634233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13445","last_updated":"2025-05-19T17:59:31Z","snapshot_observed_at":"2026-08-07T15:42:58.646426Z","submitted_at":"2025-05-19T17:59:31Z","title":"Trust, But Verify: A Self-Verification Approach to Reinforcement Learning with Verifiable Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13445","snapshot_observed_at":"2026-08-05T20:21:07.730797Z","title":"Trust, but verify: A self-verification approach to reinforcement learning with verifiable rewards.CoRR, abs/2505.13445, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.730797Z"},"links":{"cited_paper":"/paper/2505.13445","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:3caa42506bb505f8206478d900b69df4fc7d04187720652d183b71d5f39a396b","observation_id":"31165b7e-a287-40f2-af57-a8ecee7d2dbb","resolution":{"observed_at":"2026-08-05T20:21:07.730797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-12T02:21:51.598634Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T20:21:07.843467Z","title":"Understanding r1-zero-like training: A critical perspective.CoRR, abs/2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.843467Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:1236ac1ac9b6d1fc4593edc3114211f13f8329e5359bd30daa6572ae20dc48e7","observation_id":"d0e5f048-ce60-4b9d-8933-0fe3d1f6116c","resolution":{"observed_at":"2026-08-05T20:21:07.843467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:07.944339Z","title":"Inference-time scaling for generalist reward modeling.CoRR, abs/2504.02495, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:07.944339Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:f91fdfcbc3111133958dd9e4600d0c6c91c6f5964c1c6ae37b268dccbd64829f","observation_id":"135cdd04-f9ce-4df2-a4c2-2a1b862eefb8","resolution":{"observed_at":"2026-08-05T20:21:07.944339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07787","last_updated":"2025-05-12T17:39:56Z","snapshot_observed_at":"2026-08-12T05:59:19.326114Z","submitted_at":"2025-05-12T17:39:56Z","title":"Learning from Peers in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07787","snapshot_observed_at":"2026-08-05T20:21:08.060154Z","title":"Learning from peers in reasoning models.CoRR, abs/2505.07787, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.060154Z"},"links":{"cited_paper":"/paper/2505.07787","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:dd7b955ae8a2162de02471009f6a55929f3827962f329fcb831e231670b7e7fe","observation_id":"63245719-83c1-421f-965f-4e7e4baeb7c0","resolution":{"observed_at":"2026-08-05T20:21:08.060154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06781","snapshot_observed_at":"2026-08-05T20:21:08.144794Z","title":"Exploring the limit of outcome reward for learning mathematical reasoning.CoRR, abs/2502.06781, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.144794Z"},"links":{"cited_paper":"/paper/2502.06781","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:c55f84b04649dceedcc72bc1ce06fa128e277b7957c9c18501a6de50b10a72c5","observation_id":"9eaa3cc7-49dd-4760-9e89-0b0c97512861","resolution":{"observed_at":"2026-08-05T20:21:08.144794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.526136Z","title":"Nesterov and Vladimir G","venue":null,"work_id":"a8c7e13e-939e-451c-86eb-4f2d612ff332","year":2017},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.150455Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:344dc20efc9b08a030a3853c2b03cc1e8836d7b3fa8e9947595bf7e3ce4ec2a6","observation_id":"21f9c201-1872-4147-bbf2-d17c4396691d","resolution":{"observed_at":"2026-08-05T20:21:09.532062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04842","last_updated":"2026-04-12T16:48:19Z","snapshot_observed_at":"2026-08-02T13:20:15.810974Z","submitted_at":"2025-05-07T22:41:26Z","title":"Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers","version":2},"cited_work":{"arxiv_id":"2505.04842","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.04842","snapshot_observed_at":"2026-08-05T20:21:08.858224Z","title":"Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers","venue":"cs.LG","work_id":"60b17354-00f6-460f-9176-6c873d498703","year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.155057Z"},"links":{"cited_paper":"/paper/2505.04842","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:8930d7c4c974ba0a0acd0330708f8bbf7cdae14dca0b6c3ab48266e48dec7e69","observation_id":"4c3ddb77-da42-4ce6-a580-5cc87dd8b440","resolution":{"observed_at":"2026-08-05T20:21:08.865359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T20:21:08.159316Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.159316Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:87546217d636c3f3f2e336e2ad2ff23114b88a85c9d0bdd2543de1286d30a78c","observation_id":"66f0cbd1-9156-4f7c-be0c-512a26e701f1","resolution":{"observed_at":"2026-08-05T20:21:08.159316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-12T20:27:13.801957Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T20:21:08.163389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.163389Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:d575e3c3793e60fa8a8072b0515f7de27dd7fec974f37150f706c75de46ff487","observation_id":"2dc96f34-873c-4b75-ae35-482082edbde9","resolution":{"observed_at":"2026-08-05T20:21:08.163389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-10T11:02:14.031196Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T20:21:08.167577Z","title":"Spurious rewards: Rethinking training signals in RLVR.CoRR, abs/2506.10947, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.167577Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:64124933f040eaeddb72f425d92d42d33e16a8f3902ef6f7a71cb57a4102b176","observation_id":"06d7b561-f235-48b0-80e6-e4599b64f9c2","resolution":{"observed_at":"2026-08-05T20:21:08.167577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T20:21:08.171925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.171925Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:70c0be389ce664f0d0d2a7f8edfec52ae56c5cd514c5dba33d198747e21a1890","observation_id":"0d6b4713-7f46-4386-95c7-6c6a7dfa789f","resolution":{"observed_at":"2026-08-05T20:21:08.171925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.508298Z","title":"Co-Reyes, Rishabh Agarwal, Ankesh Anand, Piyush Patil, Xavier Garcia, Peter J","venue":null,"work_id":"292d45cc-f0ee-4b41-bc59-e3395aed5481","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.176068Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:272a63b3cada75ddf01f9a5b4b90852f4b5ecf83f42d40fe0043ecd4ed69a236","observation_id":"02db5137-7dcd-4074-b5f8-5b25a7ef2719","resolution":{"observed_at":"2026-08-05T20:21:09.514447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21380","last_updated":"2026-04-12T10:37:12Z","snapshot_observed_at":"2026-08-02T16:04:50.458535Z","submitted_at":"2025-03-27T11:20:17Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21380","snapshot_observed_at":"2026-08-05T20:21:08.180531Z","title":"Challenging the boundaries of reasoning: An olympiad-level math benchmark for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.180531Z"},"links":{"cited_paper":"/paper/2503.21380","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:64ebaf583eaf8a6d0ab696c78faa32c1e88f0232c990406159c1089ffb0dbb32","observation_id":"871c4546-f675-4c08-b313-9a27eaa3a600","resolution":{"observed_at":"2026-08-05T20:21:08.180531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-10T12:24:23.851162Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-05T20:21:08.184900Z","title":"Optimizing language models for inference time objectives using reinforcement learning.CoRR, abs/2503.19595, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.184900Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:3ca07b95f7636a9640dca5f8a755aa3b75011d68994b14548304f0f9c80f145c","observation_id":"8e997e85-8055-440b-a0ec-1515799f464c","resolution":{"observed_at":"2026-08-05T20:21:08.184900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T20:21:08.189939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.189939Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:89b4922f6dacf5274a1d0efac1cad316c16f38389ac696727f73171d112a7a79","observation_id":"628a0a5e-3563-4f67-926e-7662a64adb4c","resolution":{"observed_at":"2026-08-05T20:21:08.189939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.490694Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":"fd28ee25-7fb6-4d42-8bd5-27ef3b9e413b","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.194262Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:aab268a7f29c055dece90af387474e25837faaf059f39f5fe8f14529e2385570","observation_id":"0d71cc55-8d76-47da-a7e8-3bd0ded1ff70","resolution":{"observed_at":"2026-08-05T20:21:09.495740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15201","last_updated":"2026-06-10T06:51:36Z","snapshot_observed_at":"2026-08-07T15:20:22.627728Z","submitted_at":"2025-05-21T07:26:36Z","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15201","snapshot_observed_at":"2026-08-05T20:21:08.198160Z","title":"Pass@k policy optimization: Solving harder reinforcement learning problems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.198160Z"},"links":{"cited_paper":"/paper/2505.15201","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:eb7d5721b2c5f44ae642deda526073c54dde4a1d3133910208f14c1b21d2a345","observation_id":"96da9560-e314-4886-91b2-7cde506d392d","resolution":{"observed_at":"2026-08-05T20:21:08.198160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.473474Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"47fda11b-cea9-4b47-9d74-6fa2bcd3ac3d","year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.202417Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:bc8a2ff11ff92b11a1691c91a8ff21d8c631847c8b38f87bb1dfcdc6c9883427","observation_id":"46f7412a-5d75-498b-b50c-d766cf13e929","resolution":{"observed_at":"2026-08-05T20:21:09.479040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-13T06:08:42.070209Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T20:21:08.206755Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for LLM reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.206755Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:ed8af0b48ea9326ef5b0959725e8d881381474263153230f361aec6f54b9fd7a","observation_id":"8c9b5026-2071-446b-9b77-2a7369af0836","resolution":{"observed_at":"2026-08-05T20:21:08.206755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.456933Z","title":"Williams","venue":null,"work_id":"8d34984b-ff0e-4b70-a60f-c594c7bf11a1","year":1992},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.211104Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:2ac713ee973fcf721abd8a80f943e0d44c8800b54df01c25d0278da25708bb89","observation_id":"8bbbfd40-7616-42d9-8616-39e8c6566b31","resolution":{"observed_at":"2026-08-05T20:21:09.462263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:08.215587Z","title":"ARM: adaptive reasoning model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.215587Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:3eac201cf329869c3f5e8393f41e098a8e2ae3fc1468aa771d76087344c7ecdb","observation_id":"3e5fc915-e57f-440b-96a8-326d3280e5a2","resolution":{"observed_at":"2026-08-05T20:21:08.215587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-05T20:21:08.221916Z","title":"Logic-rl: Unleashing LLM reasoning with rule-based reinforcement learning.CoRR, abs/2502.14768, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.221916Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:4f42c9378aad117de51e9eece9efd32911e8a9f05689da4597041af0501e9366","observation_id":"2b52b9ed-e82c-42e1-bdb1-a84c211552fe","resolution":{"observed_at":"2026-08-05T20:21:08.221916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T20:21:08.226479Z","title":"Qwen2.5 technical report.CoRR, abs/2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.226479Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:25a4148d94d2978f94fd36e17ba3edce259f3ba590a0be9dc86af66033ebb65b","observation_id":"e394acda-e293-45be-98a7-f889ebaef45f","resolution":{"observed_at":"2026-08-05T20:21:08.226479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T20:21:08.230632Z","title":"DAPO: an open-source LLM reinforcement learning system at scale.CoRR, abs/2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.230632Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:9346ad4629307827f675cfecb6d488f2c331dae755cf8fc6b7c096fc50518ded","observation_id":"fe7ddb09-536d-440d-9862-378a9c939715","resolution":{"observed_at":"2026-08-05T20:21:08.230632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T20:21:08.234662Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?CoRR, abs/2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.234662Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:03c5fcfe824a089a639273023a4a25efe29a48ac920632e83f4a9dff82a1b35f","observation_id":"69c396b7-6c36-4336-b590-bd8dffcba871","resolution":{"observed_at":"2026-08-05T20:21:08.234662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-05T20:21:08.239014Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.CoRR, abs/2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.239014Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:2cdf0be070f7af43b2fa08d11b178a5432acb912c0e2f56f0a82290cca11b970","observation_id":"de3cb2e2-c7c8-4fea-b012-22ad3ae2bae9","resolution":{"observed_at":"2026-08-05T20:21:08.239014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:08.243328Z","title":"Boning, and Dina Katabi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.243328Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:9e9d38dd5443cc8554cf32eb1325711e46d33422951bbf40307cff6735b7d887","observation_id":"8d6ef5ab-efdf-4d0c-b7e4-1c4240bdf064","resolution":{"observed_at":"2026-08-05T20:21:08.243328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.440113Z","title":"Zeroth-order policy gradient for reinforcement learning from human feedback without reward inference","venue":null,"work_id":"97447c0f-ed5c-44be-a780-40e1d6ebade2","year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.247207Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:268ae29939ae0b6d513e497ab8d0e2e220c406cfe94049afb2464fc16bac0c8b","observation_id":"dcac152f-aad7-4d74-a694-d4bd78ebca09","resolution":{"observed_at":"2026-08-05T20:21:09.445445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-11T13:17:40.816545Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-05T20:21:08.251549Z","title":"What, how, where, and how well? A survey on test-time scaling in large language models.CoRR, abs/2503.24235, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.251549Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:f7eedc0617609ed4d1e0977febd2cf65c5dca3fe64aaf9872a57688819c19c8e","observation_id":"635baa46-0aa2-4c0c-83e7-d034e1aa98a7","resolution":{"observed_at":"2026-08-05T20:21:08.251549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16849","last_updated":"2024-12-22T04:21:30Z","snapshot_observed_at":"2026-08-12T22:20:55.999600Z","submitted_at":"2024-12-22T04:21:30Z","title":"OpenRFT: Adapting Reasoning Foundation Model for Domain-specific Tasks with Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16849","snapshot_observed_at":"2026-08-05T20:21:08.255765Z","title":"Openrft: Adapting reasoning foundation model for domain-specific tasks with reinforcement fine-tuning.CoRR, abs/2412.16849, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.255765Z"},"links":{"cited_paper":"/paper/2412.16849","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:5353a57630cb1b237dec574ee88d704a86f537255839215213dce4e12f2e5dac","observation_id":"af82a7c5-9336-4f8c-a046-38fcc0f9ade4","resolution":{"observed_at":"2026-08-05T20:21:08.255765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:08.260188Z","title":"The surprising effectiveness of negative reinforcement in LLM reasoning.CoRR, abs/2506.01347, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.260188Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:649cae4713788a7b4990de5ffb8c16c8cac49d3274c894554ae228f2eb23f8c2","observation_id":"b7303c30-23fe-4d3d-afb2-afc9e91ecb71","resolution":{"observed_at":"2026-08-05T20:21:08.260188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:21:09.423652Z","title":null,"venue":null,"work_id":"ce08c57a-9dc1-4cfc-9717-71e0660734b9","year":2006},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.264276Z"},"links":{"citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:bd805a167d21bfd59d0aa04fc97916c73cf2659777f63c286d4f78c1cbf7b1e2","observation_id":"daf99f1d-3ef1-47e9-b666-abb418f71612","resolution":{"observed_at":"2026-08-05T20:21:09.429269Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-05T20:21:08.269218Z","title":"S”, “E”, “*","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.269218Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:47088ac1674f59c97c7f1c15712935e5db8eb844fbd8bd68ea5a1063e3fa30e0","observation_id":"fac393c8-196a-40fc-aff7-6f40df93604c","resolution":{"observed_at":"2026-08-05T20:21:08.269218Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 45 inbound Pith citation observations for arXiv:2508.10751."}