{"as_of":"2026-08-10T12:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c180446c6bd64ca20031416b2ae460c52312414571085816427d62ba847c1c75","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:47:16.927539Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.23310/citation-record","integrity":"/paper/2511.23310/integrity","json":"/paper/2511.23310/citation-record.json","paper":"/paper/2511.23310"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-04T06:47:16.715714Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.715714Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:63dcfcdc54ccbf139e2872eed170cdc6c68f64c49d8bc89ca3e6e9405c7b019e","observation_id":"0624fa21-0f17-4d6c-8d54-877a33b328a6","resolution":{"observed_at":"2026-08-04T06:47:16.715714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.720985Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.720985Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:c6c09e1458863e01af52ac654c0835b356e3338ba0e6f56b4a334326f815aea6","observation_id":"cdc33d7b-b6a7-4c7d-ab3c-81ed1730e6ee","resolution":{"observed_at":"2026-08-04T06:47:16.720985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.725978Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.725978Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:875aa4dfb2d834fc8f4025051c4a0456e64698900dfe05de84e08e6e69afc6c1","observation_id":"adf254ae-7ba7-41aa-a72d-801cfec47859","resolution":{"observed_at":"2026-08-04T06:47:16.725978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.735535Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.735535Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:d96e8f80f17a7a623109dfce8e923f375c55906d603e1b1f2ba9c3fa23545cf3","observation_id":"0cbba526-11e8-4349-b46e-84ff765fce1e","resolution":{"observed_at":"2026-08-04T06:47:16.735535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.739630Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.739630Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:5985cbdf20cd61505a0dc3fbd567a1794d5c8f84f6286c038248e0e00e5d9e4b","observation_id":"42a0004a-111e-42bf-928b-975c11a0dcb5","resolution":{"observed_at":"2026-08-04T06:47:16.739630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.749076Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.749076Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:9da4cd8be177fb04a69082974c36097f6fbf04c1fe909b943a399f5a68f75008","observation_id":"b9c5c8dc-3789-4c5f-b578-07b39a20653d","resolution":{"observed_at":"2026-08-04T06:47:16.749076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-04T06:47:16.753929Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.753929Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:eadb99ad993316bd67eccc96e998a1d55902a8312ade7cd65ba77dc4ded98510","observation_id":"63dbecb6-46c8-41eb-bb11-94868fa0d084","resolution":{"observed_at":"2026-08-04T06:47:16.753929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T06:47:16.758362Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.758362Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:d456ec80338ff64e6b74ee23a5bef578f0781d1e9a3cc62067da383358ca4e20","observation_id":"661c9ad4-255c-49cb-9015-8a6eba4c3e1a","resolution":{"observed_at":"2026-08-04T06:47:16.758362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.763412Z","title":"Learning rate schedules for faster stochas- tic gradient search","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.763412Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:8e7140deb00c8456107ccdcd2be49c0f452d88a4f53de217c0dac4f918031497","observation_id":"0e304497-bff5-4a3c-9e4b-d67f9b92166e","resolution":{"observed_at":"2026-08-04T06:47:16.763412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.768142Z","title":"Note on learning rate schedules for stochastic optimiza- tion","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.768142Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:2a2e8ab58870a61d763b6a4116017319b3d343455fb08d0fd1540a2fa20752c7","observation_id":"239f436c-ad32-4b16-93cc-578fe2bac4eb","resolution":{"observed_at":"2026-08-04T06:47:16.768142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.772206Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.772206Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:b636bfe0720001e232d8c13cfbdcdb49a89377e1c7a01a5e7c88ce560d83f7f0","observation_id":"1f9a8a28-c780-4993-8e5e-d5e39d93e110","resolution":{"observed_at":"2026-08-04T06:47:16.772206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.776040Z","title":"Variance Reduction Tech- niques for Gradient Estimates in Reinforce- ment Learning","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.776040Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:cee90c8e371b09a2ea5484a3418a83bbd138a7b469560f6029302c51013eb8a2","observation_id":"c0b4841c-b26c-41d0-befa-183b775023e8","resolution":{"observed_at":"2026-08-04T06:47:16.776040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-04T06:47:16.781021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.781021Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:0581f8711b3f33c75609ebd90214325091c367cd0394378bd7418147a11f585c","observation_id":"a002a902-d8b4-45b9-a9e1-a0cc5d4d337e","resolution":{"observed_at":"2026-08-04T06:47:16.781021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.785322Z","title":"∆LNormalization: Rethink Loss Aggregation in RL VR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.785322Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:b2ecfeb37d50d25e0a9a4931d80a60992d1c9db1d133731c8df5b402dbbf69cd","observation_id":"4587cee8-b653-4aba-8d44-95657ecce8f5","resolution":{"observed_at":"2026-08-04T06:47:16.785322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-04T06:47:16.790052Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.790052Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:8229d7c13369ddaaa938a1157d5315c170ac5dc36e59e6e29786bcb749a3e257","observation_id":"578bb1d3-8a0f-467f-8119-7cb6e6938399","resolution":{"observed_at":"2026-08-04T06:47:16.790052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-04T06:47:16.794213Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.794213Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:c9ab6aabd12799c236a434f5b417cc4f1c22887c38c9ed79f2126d1e155dae1d","observation_id":"0e1c747e-fd15-4ee6-bb25-3c02c9213ba0","resolution":{"observed_at":"2026-08-04T06:47:16.794213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.798542Z","title":"Buy 4 REINFORCE Samples, Get a Baseline for Free!","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.798542Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:4439e322fc18c9576472c283ca3ab1f720b5a240d78d75d9402f9bae794d7803","observation_id":"d7b88388-7154-4c8e-a414-6fb6cdcf752d","resolution":{"observed_at":"2026-08-04T06:47:16.798542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.802389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.802389Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:75191f558c1facc090a9cf7646dfa56f94394c6e02d2e916b66e4254c301ef1e","observation_id":"6f97b477-1bbf-47cc-bcec-5b7fc3c5ca07","resolution":{"observed_at":"2026-08-04T06:47:16.802389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07454","last_updated":"2019-11-21T11:01:34Z","snapshot_observed_at":"2026-08-08T14:05:33.854211Z","submitted_at":"2019-10-16T16:22:58Z","title":"An Exponential Learning Rate Schedule for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07454","snapshot_observed_at":"2026-08-04T06:47:16.806756Z","title":"An exponen- tial learning rate schedule for deep learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.806756Z"},"links":{"cited_paper":"/paper/1910.07454","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:5fd118fe8c707abc03113945a7fd29265232592740b81a38280d9236ed76533b","observation_id":"ed123b43-a3e8-4bbe-9566-2c76e2078605","resolution":{"observed_at":"2026-08-04T06:47:16.806756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06923","last_updated":"2025-09-08T17:36:21Z","snapshot_observed_at":"2026-08-06T22:01:12.035442Z","submitted_at":"2025-09-08T17:36:21Z","title":"Staying in the Sweet Spot: Responsive Reasoning Evolution via Capability-Adaptive Hint Scaffolding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06923","snapshot_observed_at":"2026-08-04T06:47:16.811511Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.811511Z"},"links":{"cited_paper":"/paper/2509.06923","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:be51cae19b5ed3c20745cad866aec325474f5a0f9e51f59ba0beb90f19fb9b6a","observation_id":"f658452d-372c-446c-8f25-3536e859720a","resolution":{"observed_at":"2026-08-04T06:47:16.811511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-09T00:46:31.152615Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-04T06:47:16.815569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.815569Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:ef92f456cfda9ccf1a1bf2748497e8e08ef72c7fbc184c3afb53f9590bb20969","observation_id":"cd5d6fde-b090-4875-99ab-5af041d96c5e","resolution":{"observed_at":"2026-08-04T06:47:16.815569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-04T06:47:16.820370Z","title":"Let’s Verify Step by Step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.820370Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:225603df8c127e96bf1f440484c33252ee6f2306a4baffcb435433f6e8fe260a","observation_id":"2481f592-cb45-4efc-8f9d-7efa6fdf1458","resolution":{"observed_at":"2026-08-04T06:47:16.820370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.824626Z","title":"Hugging Face, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.824626Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:f7b34c044940948bc7e044b24fa080dbabb6b671a4aed5b49b04cef77cb923db","observation_id":"61bdd327-aa75-4922-91b9-d084dec88f66","resolution":{"observed_at":"2026-08-04T06:47:16.824626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-04T06:47:16.829212Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.829212Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:bfc1d245cca7e5f1bb82adebe4b146229bf5c16fe7e2628284d6c1c605fb62af","observation_id":"5ee1bef9-544c-4d3f-992d-ad87e0e32ad1","resolution":{"observed_at":"2026-08-04T06:47:16.829212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.833625Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.833625Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:7757863a4c41eb19458d87bd50e7b5ed6c0e775131d4cc16cf211220850c40e9","observation_id":"6ca7a5e7-58a6-4d71-967f-36044d761b95","resolution":{"observed_at":"2026-08-04T06:47:16.833625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-04T06:47:16.838194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.838194Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:9ddd9d6ed516c11acb8b0df4376de6f211ca6e830a75c8833b8a0ab459436981","observation_id":"fdd799f0-cf68-4120-830f-62c763e1bfe9","resolution":{"observed_at":"2026-08-04T06:47:16.838194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.842538Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.842538Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:34487a350cb490bb3f950daf2c34399037f4848ed1a023cc68997ddd78c955ab","observation_id":"53c43904-127b-41c8-a4d9-a27bff661e3c","resolution":{"observed_at":"2026-08-04T06:47:16.842538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T06:47:16.851666Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.851666Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:107ff51fbb713d8db5c325395286673a7a29dcbf1740527163c2423d9e46fbb2","observation_id":"b2d0d4d4-e43e-4743-b662-f81eecaeff01","resolution":{"observed_at":"2026-08-04T06:47:16.851666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T06:47:16.856427Z","title":"2024.url:https://arxiv.org/ abs/2402.03300","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.856427Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:7b427c5614296804cdc800fafff29a4b5767fcdf167e413773e25f6f89121410","observation_id":"ce0a7930-a724-4ed5-a02c-e53dbd105095","resolution":{"observed_at":"2026-08-04T06:47:16.856427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-04T06:47:16.860531Z","title":"HybridFlow: A Flexi- ble and Efficient RLHF Framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.860531Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:c01719e3122b894f696ee8c34feb2e72af23b302f87852ee5c0af20e94f7bc55","observation_id":"59837580-e41f-4789-bad2-050fb675b09e","resolution":{"observed_at":"2026-08-04T06:47:16.860531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.865402Z","title":"Solving Inequality Proofs with Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.865402Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:279abb1d3129113fe4aeab40f2dc6d5423793899eb6cda03c4159aa8eae2f255","observation_id":"6f6fa42e-8205-40e2-a885-07d7c53b4bff","resolution":{"observed_at":"2026-08-04T06:47:16.865402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-04T06:47:16.869562Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.869562Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:db385d9cc4a1e2e675ab448e02736e3abb9ac0f79918bd6be756f0b242f3dcbf","observation_id":"03d3676c-ed06-4713-afe5-3a48a78a2df4","resolution":{"observed_at":"2026-08-04T06:47:16.869562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04524","last_updated":"2025-06-18T08:39:46Z","snapshot_observed_at":"2026-08-07T16:08:11.790453Z","submitted_at":"2025-04-06T15:48:26Z","title":"Trust Region Preference Approximation: A simple and stable reinforcement learning algorithm for LLM reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04524","snapshot_observed_at":"2026-08-04T06:47:16.873682Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.873682Z"},"links":{"cited_paper":"/paper/2504.04524","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:327f5d36c4cca2cb0f967e52f5365a71dc78e9bdadf6b4421c9cb8fe7903ef7b","observation_id":"d354e495-9260-4fa8-a6ce-32bd312f9be2","resolution":{"observed_at":"2026-08-04T06:47:16.873682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15201","last_updated":"2026-06-10T06:51:36Z","snapshot_observed_at":"2026-08-07T15:20:22.627728Z","submitted_at":"2025-05-21T07:26:36Z","title":"Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15201","snapshot_observed_at":"2026-08-04T06:47:16.878594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.878594Z"},"links":{"cited_paper":"/paper/2505.15201","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:98e2ef0f1fd7cbf50665606987e181d93339e646637671f6fd73b38631a69c7f","observation_id":"8d833df9-5d94-440f-816d-05e97aca4710","resolution":{"observed_at":"2026-08-04T06:47:16.878594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.883512Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instruc- tions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.883512Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:d270d1a7179dde3db959a4688634878dd17c3144da85ac0a16760d42889f6e6d","observation_id":"08af61d4-331e-4101-b547-749b90dc217c","resolution":{"observed_at":"2026-08-04T06:47:16.883512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.887324Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.887324Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:23815cd8631a41a2c1e18057bdcaf0f695020b736be9509f9a2c277d98018bed","observation_id":"a8e46482-e302-406f-9ac5-dc8dc9079681","resolution":{"observed_at":"2026-08-04T06:47:16.887324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T06:47:16.896488Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.896488Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:63014b1216dfda12fb5f2184438dae33d10f9b968260b0db56ea029686b54dcf","observation_id":"346fc257-fbc5-4f41-afff-457ce96bdd5e","resolution":{"observed_at":"2026-08-04T06:47:16.896488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-07T15:56:29.149996Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02391","snapshot_observed_at":"2026-08-04T06:47:16.900557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.900557Z"},"links":{"cited_paper":"/paper/2505.02391","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:9a2e4c6c32159896f5186cd05a5f302bb7943339c3644afd0a3328f18dc3eed7","observation_id":"f0549afe-c503-48f6-b347-d34c7c8c723c","resolution":{"observed_at":"2026-08-04T06:47:16.900557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-09T13:10:58.433740Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-04T06:47:16.891598Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.891598Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:2eccf2ecec52ecedc5b329fd1ae1b10431cde8d787e05d626fc2d8f53a96d098","observation_id":"5d203758-1e76-44d3-9140-7655cad53b77","resolution":{"observed_at":"2026-08-04T06:47:16.891598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.909663Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.909663Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:164a5a1ff08b679f36ad3910140ef39a829caad770ed0aa51c2df4b58f88cdec","observation_id":"7e36d264-33fa-4622-8aa9-c856b9a9c289","resolution":{"observed_at":"2026-08-04T06:47:16.909663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.913719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.913719Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:aac68d9314b63c82fd8b31f718410d636e60ec30c4d8e849ad32cfaa99bf9598","observation_id":"860f6358-57cb-4341-b488-26f773d3646a","resolution":{"observed_at":"2026-08-04T06:47:16.913719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.905721Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.905721Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:017cb349859668d48fdfa06fc1f32e4fa775c073d7d7fe3fc24d0a1c91668ca5","observation_id":"75231d1f-e143-44eb-8ebf-f0baf1334369","resolution":{"observed_at":"2026-08-04T06:47:16.905721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.918458Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.918458Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:945d7d88d4f0ac11f60e5f43b6c69300284acf377450c2ec9afd0acf88d63945","observation_id":"9a9f983f-0143-4fbe-99b7-51d84f4debc0","resolution":{"observed_at":"2026-08-04T06:47:16.918458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T06:47:16.927539Z","title":"Formally, we consider min {Nt}T−1 t=0 ,{G t}T−1 t=0 E L(θ T ) s.t","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.927539Z"},"links":{"citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:1326d4f9875ded2e462192aee6c82144fae602c3e70fe6e8a4dce9c0519f152d","observation_id":"20550033-098c-4543-b10d-e51c4554550c","resolution":{"observed_at":"2026-08-04T06:47:16.927539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1206.5533","last_updated":"2012-09-16T17:49:12Z","snapshot_observed_at":"2026-08-03T14:15:44.080315Z","submitted_at":"2012-06-24T19:17:35Z","title":"Practical recommendations for gradient-based training of deep architectures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1206.5533","snapshot_observed_at":"2026-08-04T06:47:16.730490Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.730490Z"},"links":{"cited_paper":"/paper/1206.5533","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:7d712da446db0d32167ca4b8c77b2ab9236485213d61cc5c7ee522367a876f00","observation_id":"e08aa9e3-008c-44d0-b1f5-b4efd877269b","resolution":{"observed_at":"2026-08-04T06:47:16.730490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02231","last_updated":"2023-11-02T22:47:14Z","snapshot_observed_at":"2026-08-10T02:15:39.974235Z","submitted_at":"2023-06-04T01:59:40Z","title":"Fine-Tuning Language Models with Advantage-Induced Policy Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02231","snapshot_observed_at":"2026-08-04T06:47:16.922717Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.922717Z"},"links":{"cited_paper":"/paper/2306.02231","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:dd915c1d3df5a2c2c7feeaf262c774d9808a1632c3d6ed98ddf0b3393a894f34","observation_id":"0d2ee59d-f3c4-464d-8a00-1d3a097ef619","resolution":{"observed_at":"2026-08-04T06:47:16.922717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20686","snapshot_observed_at":"2026-08-04T06:47:16.744697Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.744697Z"},"links":{"cited_paper":"/paper/2505.20686","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:576eebc851488f5d845ae352aad6240936f08c6e0a4c879cd8599b09eb5806ad","observation_id":"62febf29-27b9-4adc-8355-6fec57b6f8b8","resolution":{"observed_at":"2026-08-04T06:47:16.744697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","latest_version":4,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2511.23310."}