{"as_of":"2026-08-14T13:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b143636878a7572afb8fb807859d97c7496f0e5df9beca6c92df19a6911806e5","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:21:57.143016Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:49:54.921367Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-07-14T06:44:16.198117Z","title":"2606.06080 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11146","last_updated":"2026-07-13T06:37:42Z","snapshot_observed_at":"2026-08-14T08:22:40.912289Z","submitted_at":"2026-07-13T06:37:42Z","title":"Rank-Conditioned Sample Reuse for the Plackett--Luce Best-of-$K$ Objective","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-14T06:44:16.198117Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2607.11146"},"observation_digest":"sha256:4b80ba70e3ca93fe773b52c6f73f3b169e1c054c61a042181a3c92ef2cf357ea","observation_id":"2ab39a61-7fdc-44b9-ba0c-266f239da232","resolution":{"observed_at":"2026-07-14T06:44:16.198117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-08-02T00:41:12.582293Z","title":"On advantage estimates for Max@K policy gradients.arXiv preprint arXiv:2606.06080, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14962","last_updated":"2026-07-16T13:14:21Z","snapshot_observed_at":"2026-08-14T02:06:21.782867Z","submitted_at":"2026-07-16T13:14:21Z","title":"Multi-Axis Max@K Reinforcement Learning for Representative Diversity in Text-to-Image Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:12.582293Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2607.14962"},"observation_digest":"sha256:796fc9fa94a9d33f472c8c9483895b37de521f3aadbb538b12d35cf2a429a110","observation_id":"d3a013a1-75d5-4f88-a672-5f78cae46762","resolution":{"observed_at":"2026-08-02T00:41:12.582293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06080","snapshot_observed_at":"2026-08-04T00:49:54.921367Z","title":"2606.06080 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00296","last_updated":"2026-07-31T21:11:48Z","snapshot_observed_at":"2026-08-12T20:08:10.136772Z","submitted_at":"2026-07-31T21:11:48Z","title":"Stabilized Best-of-$K$ Training for Neural Combinatorial Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T00:49:54.921367Z"},"links":{"cited_paper":"/paper/2606.06080","citing_paper":"/paper/2608.00296"},"observation_digest":"sha256:c423fd4ad4c743173fa1626784ae6b1c8420815f3c1cf29fa92d4c50a6534611","observation_id":"006768af-557e-43b9-92c8-62ce1a4519a5","resolution":{"observed_at":"2026-08-04T00:49:54.921367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.06080/citation-record","integrity":"/paper/2606.06080/integrity","json":"/paper/2606.06080/citation-record.json","paper":"/paper/2606.06080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Finite-time analysis of the multiarmed bandit problem.Machine learning, 47(2):235–256, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:1203a53afcacda1e280a62fe9642a6ab78a1609f0ae5588c3f1f7c9fc4ebe801","observation_id":"e9d87534-3b86-49b4-9d36-52120868d367","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:56.995100Z","title":"The best of n worlds: Aligning reinforcement learning with best-of-n sampling via max@ k optimisation","venue":null,"work_id":"92afd1d0-76d7-404f-bb98-a521406f2c18","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:d4dec25059de29e7920b4d3708dfb473e5f7a2447d457acd51c8412c651c3d22","observation_id":"543eebbd-3c98-410a-ac7e-bfae8c3bea4e","resolution":{"observed_at":"2026-07-02T12:06:56.456387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12735","last_updated":"2025-02-07T02:13:27Z","snapshot_observed_at":"2026-08-14T12:25:36.911347Z","submitted_at":"2025-01-22T09:12:09Z","title":"Online Preference Alignment for Language Models via Count-based Exploration","version":3},"cited_work":{"arxiv_id":"2501.12735","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12735","snapshot_observed_at":"2026-07-03T04:17:37.298243Z","title":"arXiv preprint arXiv:2501.12735 , year=","venue":null,"work_id":"ed782cfe-3240-4098-b5b8-77340b192a69","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2501.12735","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:cea893f2eb965706c550d0381ab4331d998e3664fdcb3389d46aca10e15bdd46","observation_id":"7e4c3140-62f9-4b08-b63f-b3e808a90c04","resolution":{"observed_at":"2026-07-02T12:06:56.459065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:16:57.011864Z","title":"Post-training as reweighting: A stochastic view of reasoning trajectories in language models","venue":null,"work_id":"8c3af321-88c8-423e-84f7-acaa90a08cbb","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:fdd9cbd2d92acd5314246e62c3deefd2f0ca20b9d91f24a9e645550a2aaafe39","observation_id":"f0ec27f7-9f27-4d97-b816-ae168c473926","resolution":{"observed_at":"2026-07-02T12:16:56.591850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-13T05:40:28.055216Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":"1810.12894","doi":"10.48550/arxiv.1810.12894","metadata_source":"pith","pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploration by Random Network Distillation","venue":"cs.LG","work_id":"5a87fef6-96e2-4d5b-91ec-1a7c9a43cab9","year":2018},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:2faba3d3d9f2799a3711a918fae91ce35b1010a6b368930d92bfe84f042fe790","observation_id":"2d3a9e82-3707-4987-b5c4-6cf763edcbcd","resolution":{"observed_at":"2026-07-02T12:06:56.450761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:38:56.018423Z","title":"arXiv preprint arXiv:2510.15020 , year=","venue":null,"work_id":"6a468d06-b0b2-4d32-85fd-004b5cb11cc7","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:22e9500ed93f3d90d036c74681a7e60ed85fc0001bbc56a41d870b9ae3ad6b61","observation_id":"35de7610-04bb-4d37-98cb-04f19d3a0d84","resolution":{"observed_at":"2026-07-02T12:06:56.385892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:63541baf84f59d08c2ac33a1852cc5f23658ebf2a705e735da45ab3d3972303f","observation_id":"619fa3af-3bf9-43b9-b1cd-5cbf31564b8a","resolution":{"observed_at":"2026-07-02T12:16:56.588901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:7d1b65d48879a08337f47a5a91bf0e86381cde6effecc645c7913da979c359ca","observation_id":"b02f5bbd-79a9-4cf7-8857-b3f6bccb225e","resolution":{"observed_at":"2026-07-02T12:06:56.383237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i36.40290","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with exploration: An entropy perspective","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"1dca8017-ef26-4784-bb13-14697377df46","year":2026},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:4d7a0721e635c08e1fc2bf78e8da0980be8b3d87c20ed61f0eab2224481c976b","observation_id":"eb6b85f0-3116-4476-ae8d-a83788160ada","resolution":{"observed_at":"2026-06-28T02:31:30.232165Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-22T10:23:20.511749+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T10:23:20.511749+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:18c351765a368517cf831a0dc1d6c286b9842a887b3a2400df79981143390cb8","observation_id":"02b542aa-6423-49ae-b28c-45706bdeecf5","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Beyond variance reduction: Understanding the true impact of baselines on policy optimization","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:3f6017c1bf546be76ad12a62dd91cb5737e3c89dece60edd6d6c8e31e512c92c","observation_id":"42035913-4b5e-4044-92b9-ac0aa32f408b","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:ce18ce8782172b9a06c0181a98117b07e381c4262256f3a3b94539360d854a10","observation_id":"245a53bb-ddc2-425b-b236-3491c3f5ee93","resolution":{"observed_at":"2026-07-02T12:06:56.425930Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:fe9e619cda31c8974cf21f4ce0b9c99bcd23f570772f320a5207be79357ad00b","observation_id":"6b214efe-25b4-4ae3-833c-fbbe217175a7","resolution":{"observed_at":"2026-07-02T12:16:56.585783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Weight ensembling improves reasoning in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:ea9305ae0a5ec4d702a46eb83b0dbacd6b830935109951e4c3b9e3ea99989dc9","observation_id":"49c68fd0-b753-4d53-8b62-5e7babe84c66","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:59:40.186056Z","title":"arXiv preprint arXiv:2505.17621 , year=","venue":null,"work_id":"035ff294-c5e5-4e88-ae7a-0df158e76e15","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:6981bac8a568f74f33baeef2120b0ae7a3ae392dc827b4be73236d9ae777f40f","observation_id":"3c8b4829-1361-4583-beb0-91682e013424","resolution":{"observed_at":"2026-07-02T12:06:56.461761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:96eb6d5a6e682ed8588b726e6822145919688294de7d52ce20c21b06454cff53","observation_id":"fd41b64d-5172-4cca-b828-31ffe3f6ec93","resolution":{"observed_at":"2026-07-02T12:06:56.443870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Variance reduction techniques for gradient estimates in reinforcement learning.Journal of Machine Learning Research, 5(Nov): 1471–1530, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:d03e0937b4059d1bf9cf5779836abb1b8e344e082b24712ac144253f498d03d6","observation_id":"fdccaf20-1b01-4608-ae6f-ea37d8c6fe86","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05176","last_updated":"2016-02-25T20:36:21Z","snapshot_observed_at":"2026-07-06T04:36:42.881459Z","submitted_at":"2015-11-16T21:08:25Z","title":"MuProp: Unbiased Backpropagation for Stochastic Neural Networks","version":3},"cited_work":{"arxiv_id":"1511.05176","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.05176","snapshot_observed_at":"2026-07-02T12:06:56.447450Z","title":"MuProp: Unbiased Backpropagation for Stochastic Neural Networks","venue":"cs.LG","work_id":"6b06a0b4-c215-47db-b876-9330312b1194","year":2015},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1511.05176","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:9d6378cfdddafd301eea7279b115c0e8548c1c87dbf977fd964d48c6de8793eb","observation_id":"ea11b413-dd9c-4a29-b2db-4a27d8b283c9","resolution":{"observed_at":"2026-07-02T12:06:56.448633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b579929441382abf8d850932b0ffa694023d056cf8fd0b9e8e02ed505c152c57","observation_id":"30aa64ea-53b9-42ce-bbe1-0fb09374700d","resolution":{"observed_at":"2026-07-02T12:06:56.426380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02355","last_updated":"2025-06-20T04:14:47Z","snapshot_observed_at":"2026-08-13T07:28:13.001627Z","submitted_at":"2025-06-03T01:15:15Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","version":2},"cited_work":{"arxiv_id":"2506.02355","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02355","snapshot_observed_at":"2026-07-03T20:38:55.917128Z","title":"Rewarding the unlikely: Lifting grpo beyond distribution sharpening","venue":null,"work_id":"349bfcd5-c482-404a-961a-599b6e5813d9","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.02355","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b9c1a0cea5b5181fd1aada7f75baf36aa9f0da68d2cd7e5120411869d270e39c","observation_id":"83954b2f-cd48-4257-adb2-0de7f8459dc4","resolution":{"observed_at":"2026-07-02T12:06:56.428956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f31c57282ec07fb1a5530693455b6cdb7372af1fd6a117f5256d8e7891605666","observation_id":"8a335aa8-db5f-4693-82ea-ad6329f24100","resolution":{"observed_at":"2026-07-02T12:06:56.433525Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"A class of statistics with asymptotically normal distribution","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c1512c363d27c4a07107670611d94c3aeac428ff86b9a22e6ea975b17eda57bb","observation_id":"c51556c9-30e1-4ed6-bf1e-22f81ba35f0b","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23629","last_updated":"2026-05-07T02:29:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T04:10:37Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","version":3},"cited_work":{"arxiv_id":"2509.23629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23629","snapshot_observed_at":"2026-07-10T11:37:03.356545Z","title":"Emergent Slow Thinking in LLMs as Inverse Tree Freezing","venue":"cs.AI","work_id":"82ef2feb-9982-4d37-bac4-f9efd152cbce","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2509.23629","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:3e23530ff8cb717c97a1085ad27a6d9e6879aaeda59153a1acdd221715aff043","observation_id":"5aca0c07-0b64-4efe-a780-00e35b22a508","resolution":{"observed_at":"2026-07-02T12:06:56.448464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:26:26.299960Z","title":"arXiv preprint arXiv:2509.25133 , year=","venue":null,"work_id":"27ca51ae-e57f-4f13-9b0c-155064ec727b","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:2dadd8eb8759f6544500a68ba2db1f9655e24168cf0c766d482cf141685d42ad","observation_id":"64be959f-a0ba-4b75-b248-ea764785db81","resolution":{"observed_at":"2026-07-02T12:06:56.421477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:3aae046c47c1a183bdf536c72dc8e8585ce874f8956d11c1ef05ac2239da4b9e","observation_id":"5bab3412-5500-4e49-a263-ee8e2e57402a","resolution":{"observed_at":"2026-07-02T12:06:56.431368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Emergence of exploration in policy gradient reinforcement learning via resetting, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:cf0166d498f258b414a435ff123470c5aadcf7fa3230be78340bbb0005cf38b6","observation_id":"f8241fdf-c3de-44fd-9bfd-1bdff93c5bd8","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Hwang, Jiangjiang Yang, Ronan Le Bras, Oyvind Tafjord, Christopher Wilhelm, Luca Soldaini, Noah A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:0ff7f731e47e478bd1d2a9b6a1dc16842d5cda1941dd99f1f9ac23595d58118e","observation_id":"f7c6c964-53e6-483f-96f9-7b9a743c4b83","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:8eb50189f47e8c282e8564cfe523a344c3df5d8ea86d5fed6e49675896148c2e","observation_id":"0a9baef8-00ab-4443-8d09-a9c68b841d2c","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02534","last_updated":"2025-09-02T17:38:47Z","snapshot_observed_at":"2026-08-13T07:24:20.597995Z","submitted_at":"2025-09-02T17:38:47Z","title":"Jointly Reinforcing Diversity and Quality in Language Model Generations","version":1},"cited_work":{"arxiv_id":"2509.02534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02534","snapshot_observed_at":"2026-07-04T21:00:08.446955Z","title":"Jointly reinforcing diversity and quality in language model generations","venue":null,"work_id":"8405556c-8f03-4c5d-b431-dc9d044e390b","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2509.02534","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:1bd87ae36ace8c95fd944d89ec74935db8a19195d259f9abd527ddeff09df419","observation_id":"566591fd-f894-43e7-9ac0-cc2a9b78f151","resolution":{"observed_at":"2026-07-02T12:06:56.451211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.372600Z","title":"Can llms guide their own exploration? gradient-guided reinforcement learning for llm reasoning","venue":null,"work_id":"2a20b1ce-d30e-4599-9057-c9f6932478b7","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:9b43c4b2704984cb590119f987348311be99de8e3e1a783b786747962c92354c","observation_id":"dee092f5-63ba-44e7-b934-48b10a46b4f9","resolution":{"observed_at":"2026-07-02T12:06:56.453670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:3d11cb43471c2c27e7763fbb62d803f343072ad3481322274499a24838e29a58","observation_id":"70c5232d-eba7-4788-9178-9635a7407d29","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"RL squeezes, SFT expands: A comparative study of reasoning LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:8305ca92394f25d46b3eac0adb5a4063452b58dcb3a29fcca1c727e85e0bde57","observation_id":"740d59f0-ac71-408a-b8e8-e6c15fab080c","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"The role of baselines in policy gradient optimization.Advances in Neural Information Processing Systems, 35:17818–17830, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f73ea713b7e5fc6f48a81f3fb87546ae64db753d644a8b63652bf6ada2686f72","observation_id":"ac8ec50a-cae2-4cbe-b7dd-50064f44a405","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Variational inference for monte carlo objectives","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:ce896a75702a6ee40d4c8ca568c19e7d52b3e33b2bcc41373249b5b20078ae1b","observation_id":"fdb5b8d2-32fc-4a8e-a7eb-a6c7ad61f758","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Asynchronous methods for deep reinforce- ment learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:0fdc4e8f38cb8272dc9ae4eb44963f5f507ed3674301e21e5fac29d09ba252e0","observation_id":"a487ccb8-4605-4075-bec3-882270cf3202","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Emergence of exploration in policy gradient reinforcement learning via retrying","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:5b41f564feeee3e973cf505c54cef033f2831bf13d719a98d85ae0c16a998b4f","observation_id":"c3ff4086-40b9-4c50-8d35-d67f261fd71f","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:d91fad81d743d1a49cfe4c30f6d3ac4f99412767ec3abe75fc70655aa16c00f9","observation_id":"aaa432fd-26ee-46e7-90a0-daaa390eefc8","resolution":{"observed_at":"2026-07-02T12:06:56.440986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Total stochastic gradient algorithms and applications in reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b38e7904bbc84038a8c19e838f8e59584c285aff817436971096f10957b74614","observation_id":"068f44fa-383d-40bf-abad-a46d3f9217a8","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"A unified view of likelihood ratio and reparameterization gradients","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c4acb5c4bc96ece470e298264d2f81e1f60210797a2be130f59d1ca8bce85601","observation_id":"7cc8d450-5098-41bb-ba1a-81b35467b508","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"PIPPS: Flexible model- based policy search robust to the curse of chaos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:2cef84041f0f2109cd53c5cd6a685aa54423c13bb952be5f9e3ee19d130a9504","observation_id":"5f33d517-d2b8-42e5-bed0-3e293bcb355f","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14807","last_updated":"2026-06-16T08:24:10Z","snapshot_observed_at":"2026-08-13T17:45:23.044567Z","submitted_at":"2025-10-16T15:40:49Z","title":"Beyond the Sampled Token: Preserving Candidate Support in RLVR","version":3},"cited_work":{"arxiv_id":"2510.14807","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14807","snapshot_observed_at":"2026-07-03T21:08:57.699582Z","title":"Simko: Simple pass@ k policy optimization","venue":"cs.AI","work_id":"29212f52-a9c4-4214-85da-144ddfcc8042","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2510.14807","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:8e439a37be3fb684628381b71707cfbc4f8b2c9c4654dadb0141462547cd157a","observation_id":"ccc58204-e901-4294-bf34-6fc3d3bb8c40","resolution":{"observed_at":"2026-07-02T12:06:56.431196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Reinforcement learning of motor skills with policy gradients","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:3b95e263b5c92f50eb56145ac43e3608a26ae480d481e17157d00cdf921bf9ba","observation_id":"80b04d8c-869a-437f-896e-e1f698062db6","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:fd21ece09b0719a8cc386e9c8dd8463ddd9855f77f53ecef9ac93e86953f847a","observation_id":"feda5041-2619-462f-bc64-efacbe01732e","resolution":{"observed_at":"2026-07-02T12:06:56.406133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-14T00:13:00.965119Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:f7cd146cd81834ae94f39f95187ec421f2591db021999972c3f6225de7d130a0","observation_id":"978bf51c-3054-476a-bfff-6e3746dd43dd","resolution":{"observed_at":"2026-07-02T12:06:56.433620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04022","last_updated":"2025-04-05T02:24:07Z","snapshot_observed_at":"2026-08-10T14:50:30.906495Z","submitted_at":"2025-04-05T02:24:07Z","title":"Rethinking Reflection in Pre-Training","version":1},"cited_work":{"arxiv_id":"2504.04022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04022","snapshot_observed_at":"2026-07-05T10:20:57.237283Z","title":"Rethinking reflection in pre- training.arXiv preprint arXiv:2504.04022","venue":null,"work_id":"dd1b4e9d-9546-4ae2-80c3-4c45b9cf7b90","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2504.04022","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:5aa80a0fd1b02a80f10c41985e105c7114f1f438c26c6766da3368cc9f7c5f4e","observation_id":"283fed06-b34b-4ef7-9aa5-28b5431b5e8f","resolution":{"observed_at":"2026-07-02T12:06:56.418746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:388bd9dcd19eb6d04d277fbe91d40a75e6d1bc162477f6a82cea7ecfc2f68d22","observation_id":"9c98f150-8c58-49ba-a853-dd94deba054c","resolution":{"observed_at":"2026-07-02T12:06:56.436184Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"On entropy control in LLM-RL algorithms","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:3c569b159d2be8079a5c4f87878f9c1cb65caac2a643d55cdf54931e947fb0a4","observation_id":"a6ffc73c-cf59-4104-8cc2-e6ef512812c5","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b05d7f016f36c4b79633cc68051a08f068f79bedf55cbae81c1cd6bc84a597fe","observation_id":"5f9f6c87-a403-485b-b3d9-44f4ae530620","resolution":{"observed_at":"2026-07-02T12:06:56.443553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:1cc59f0362aeb3c30fd882f76537259ad2e9cd9a460eb75e4ae0d3a02d3b4713","observation_id":"04a2bc2c-32e2-40d3-9bb4-51b9022ca6e9","resolution":{"observed_at":"2026-07-02T12:06:56.413899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Kakade, Dean Foster, and Udaya Ghai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b9881ea957e1c83debf03ae1e70606ced623ad77b8c3841a053b8a7ab0413fe6","observation_id":"f3ea7472-d129-4b72-9155-eedbf8a6b1eb","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Optimizing language models for inference time objectives using reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:fdf050fc655bee847cc7f56a1e8c33134776a4fdbae74c6ddf24c14d0edaa5a2","observation_id":"56ae5afe-71fd-4cb8-be8d-debda028fceb","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Rebar: Low-variance, unbiased gradient estimates for discrete latent variable models.Advances in Neural Information Processing Systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:aa32dd2ca6afb9e149da15da961e096a9e197d7faaf4a3f92533f8dd19768ecb","observation_id":"c9bdda4e-318e-41e5-a871-8b21caaf1d0a","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"cited_work":{"arxiv_id":"2510.11686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.11686","snapshot_observed_at":"2026-07-16T02:22:28.823656Z","title":"Representation-based exploration for language models: From test-time to post-training.arXiv preprint arXiv:2510.11686","venue":null,"work_id":"d87f359a-d84a-4789-a7ba-032baf0f3636","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2510.11686","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:e7d11a9d7a40119f8acac4584237c4e59e39b1ab51121779ea6e69d44cc2b090","observation_id":"a4c882a5-141e-4c30-8a1d-7f1111eae931","resolution":{"observed_at":"2026-07-16T02:22:28.823656Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Pass@K policy optimization: Solving harder reinforcement learning problems.Advances in Neural Information Processing Systems, 38: 152416–152445, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:4d7220e3cd3308290d295ced4a6e683aa2efe81d933edf7a7264986acfc96abf","observation_id":"04c33fe3-4eb1-414f-b0aa-153b880ba2e8","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":"2506.20512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-07-04T13:59:51.967723Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":"89e55f68-3f36-40a1-bd9e-4bd253e3c1e9","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:46fff2afada0a66ee16d42ac7a120781b2e62958bda24091b0fe411f79834936","observation_id":"669a75df-30e2-4d7a-831d-0b8a5667faa5","resolution":{"observed_at":"2026-07-02T12:06:56.418404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.2315","last_updated":"2013-01-10T16:26:53Z","snapshot_observed_at":"2026-08-08T19:30:35.157549Z","submitted_at":"2013-01-10T16:26:53Z","title":"The Optimal Reward Baseline for Gradient-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1301.2315","doi":null,"metadata_source":"pith","pith_arxiv_id":"1301.2315","snapshot_observed_at":"2026-07-02T12:06:56.444841Z","title":"The Optimal Reward Baseline for Gradient-Based Reinforcement Learning","venue":"cs.LG","work_id":"648dcf97-3314-429a-8c68-6b3dd556ccea","year":2013},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1301.2315","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:43d022953e2ad8676a81cecca9237b115fb105356622f4cbd369844fabb837c8","observation_id":"6f6f9517-3815-4785-b5b3-3c9765a0d875","resolution":{"observed_at":"2026-07-02T12:06:56.445997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14245","last_updated":"2025-10-02T11:31:47Z","snapshot_observed_at":"2026-08-13T08:32:24.716266Z","submitted_at":"2025-06-17T07:06:56Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","version":2},"cited_work":{"arxiv_id":"2506.14245","doi":"10.48550/arxiv.2506.14245","metadata_source":"pith","pith_arxiv_id":"2506.14245","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning with Verifiable Rewards Implicitly Incentivizes Correct Reasoning in Base LLMs","venue":"cs.AI","work_id":"fa639861-d1ef-4d97-80bd-79e11a62e73c","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.14245","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:778d9be70670e25bc0a34e8fcc721250951725779dc696c080b0d44614bdce91","observation_id":"195d58b3-f851-4598-8de3-4768f6b75741","resolution":{"observed_at":"2026-07-02T12:06:56.454152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.Machine Learning, 8(3):229–256, May 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:36539d02127e42e7ee15dcd7f9b8b92f8e9253388239d5c1fea199b1157bd862","observation_id":"59aaf811-b77f-4c93-81dc-59f67d2d8af0","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07246","last_updated":"2018-03-20T03:52:04Z","snapshot_observed_at":"2026-08-14T08:55:36.372678Z","submitted_at":"2018-03-20T03:52:04Z","title":"Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines","version":1},"cited_work":{"arxiv_id":"1803.07246","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.07246","snapshot_observed_at":"2026-07-02T12:06:56.457970Z","title":"Variance Reduction for Policy Gradient with Action-Dependent Factorized Baselines","venue":"cs.LG","work_id":"744349fa-8fea-4267-b41a-828de09ed0eb","year":2018},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/1803.07246","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c3f8f8b723fb6a78caba92c3b688085c825c484c9469347036f0f3b5f0dd86a3","observation_id":"8792cc16-08d9-48c6-9f54-e21cc4766a3a","resolution":{"observed_at":"2026-07-02T12:06:56.459203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.14843","doi":"10.48550/arxiv.2507.14843","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The invisible leash: Why rlvr may or may not escape its origin","venue":"arXiv (Cornell University)","work_id":"71f17397-1cd4-4f68-ab1d-e91bb5f5953d","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:322db033f050c0249bc069d792e2235b8a31692386abafee1c9ec4b8a93522b4","observation_id":"2e4e9f0b-bf9f-4747-b751-ac5e31ba3107","resolution":{"observed_at":"2026-07-02T12:06:56.438710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-13T17:31:32.138475Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:9711f59b719097493458b74d16a0577e6ec9aa5ee189e10f9893adae758c5083","observation_id":"b092c4ec-69cc-4936-a8eb-095eaa57e1d3","resolution":{"observed_at":"2026-07-02T12:06:56.438752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:26318212babdee6eb1d1ce2e97ba39e2237402d1c3c3a53a8824f3f8d5ab5436","observation_id":"14dd87cb-18e1-40c3-ae63-0b100ed34c89","resolution":{"observed_at":"2026-07-02T12:06:56.456829Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:1df9c0c83b36af55f90576eacd97a5de75f0320ac5bb820cc8929cb7219c674a","observation_id":"51bec505-12cd-4214-814a-f74b1d3f61ef","resolution":{"observed_at":"2026-07-02T12:06:56.446201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02172","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:06:56.401499Z","title":"arXiv preprint arXiv:2510.02172 , year=","venue":null,"work_id":"f7ef98ea-f2a8-4642-b3e0-d62a5235723f","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:e72eb125cc59477838c5550e6a702fc5d725957f32ac8a8fa2e37271e1d22ce4","observation_id":"d725b3bd-2cd2-4efe-beba-0877aaf7be3e","resolution":{"observed_at":"2026-07-02T12:06:56.403210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model? InThe Thirty-ninth Annual Conference on Neural Information Processing Systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:e239df7506f55e7057d621036b782ae4966fafa468b4833d93094ceb82a7e730","observation_id":"5f93d10b-abed-4841-b427-b5c443caddea","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:00:08.493261Z","title":"On the interplay of pre-training, mid-training, and rl on reasoning language models, 2025 a","venue":null,"work_id":"0e148fc4-dd1f-4b6f-946d-385c5883da2b","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:efa47b7c6f4c7c9e422c5688baf448ff864837cd2b7becb35132c3a73b1a7db8","observation_id":"826dfcea-4e34-4dc2-9e96-5a9b3c583ec9","resolution":{"observed_at":"2026-07-02T12:06:56.411254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:36.802333Z","title":"arXiv preprint arXiv:2509.25810 , year=","venue":null,"work_id":"28247d93-ae55-4004-9a8f-b6a9e538309f","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b536b236a3945902d6a64e0353826b95e9d728313f6f015639a29f539defb36c","observation_id":"b436eb3d-c72a-4ac2-9093-dd0f0dd13dfb","resolution":{"observed_at":"2026-07-02T12:06:56.413232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:b75ff3ac6d00049a002172461cde91e21c84dce0c8ae902b9bf76638e4a6e29a","observation_id":"066f4021-50c9-41a4-b696-2c794db103c3","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:e309450f5bba3cf9ddbc4639a8203a182e605f89b297ed579e05347ef2c9ca25","observation_id":"4c242cd4-ec7c-43f0-901d-3edb7e28c52e","resolution":{"observed_at":"2026-07-02T12:06:56.403920Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-07T21:24:46.836836Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"cited_work":{"arxiv_id":"2507.07017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.07017","snapshot_observed_at":"2026-07-04T09:09:43.539228Z","title":"First return, entropy-eliciting explore.CoRR, abs/2507.07017","venue":null,"work_id":"08bca174-6da3-4a11-adb1-c048a8af61d4","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2507.07017","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:5d2ac277fb355736bc3f445d872406b061ec523ae6a00145289a4269c09f35a5","observation_id":"024e228f-8c3a-40b3-93a7-ae7df8bbde22","resolution":{"observed_at":"2026-07-02T12:06:56.398549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15194","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.406410Z","title":"arXiv preprint arXiv:2509.15194 , year =","venue":null,"work_id":"9e4533d3-39f4-4116-a575-d72a6e615941","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:235a30d18d1660d2d665258183629de69bad7b5c38d72762322ebc3060505b78","observation_id":"cc922107-1b70-4dd9-9ba4-9d7318dd7fe2","resolution":{"observed_at":"2026-07-02T12:06:56.400294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"[29] employed a semantic diversity score with an external semantic comparator, and Tuyls et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:2658db37ec584b74a4d794eb3aee535cf3a4eafc715c7144b60d7fee1f2f0571","observation_id":"183e932e-84d4-4260-9a22-8f1071cb96e1","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"Setlur et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:a8d3792fdc61ea5f61eb0acd21c8be17e50755d454eb245238d7f4357bd69c4d","observation_id":"f90062a8-11fd-4ccc-a88a-7c00d637077d","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"\" \" Com pu te s bi no mi al c o e f f i c i e n t C (n , k ) in log - space","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:fe23a6236bb1e9a7dd82dcab93042252147f81327b899a2831d2e821f2f89ccf","observation_id":"855ae7c3-8db9-4d06-9bfe-5b17296af384","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:21:57.143016Z","title":"BoN mean","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:17d6d859eadae237612c0a50358304780a59494c3caf732b3273127031aa4e22","observation_id":"8fc7501e-7b95-47e5-986c-f736fdc0740b","resolution":{"observed_at":"2026-06-28T02:21:57.143016Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T12:04:08.657900Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":30,"verified_exact":41,"verified_fuzzy":0},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 3 inbound Pith citation observations for arXiv:2606.06080."}