{"as_of":"2026-08-09T19:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4ed1a4a630dbe1b76d342fea32f1902719edbfda9867dc81dee132728c712bd","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:08:26.418982Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:21:41.900632Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T06:06:40.819064Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-06T21:21:41.900632Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00417","last_updated":"2025-07-01T04:10:15Z","snapshot_observed_at":"2026-08-07T07:50:07.171627Z","submitted_at":"2025-07-01T04:10:15Z","title":"ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:21:41.900632Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2507.00417"},"observation_digest":"sha256:7417ffa33986953ef5bdbd7668d512e96710ce1d0e40a10a301e5746c618b59e","observation_id":"2c78ad0a-163e-4860-87d2-2b82f402346b","resolution":{"observed_at":"2026-08-06T21:21:41.900632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-06T20:26:46.857127Z","title":"David JC MacKay","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02841","last_updated":"2025-07-03T17:51:06Z","snapshot_observed_at":"2026-08-09T11:34:54.873283Z","submitted_at":"2025-07-03T17:51:06Z","title":"StepHint: Multi-level Stepwise Hints Enhance Reinforcement Learning to Reason","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:26:46.857127Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2507.02841"},"observation_digest":"sha256:af94f21fbaeaaee25fd767581c996eb5504ac891fd25be6a81346992f46ca710","observation_id":"c1e0f7d7-0436-40f6-9d38-34d50fec9880","resolution":{"observed_at":"2026-08-06T20:26:46.857127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-08-05T14:35:50.973056Z","title":"Ang Lv, Ruobing Xie, Xingwu Sun, Zhanhui Kang, and Rui Yan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21188","last_updated":"2025-09-02T16:27:24Z","snapshot_observed_at":"2026-08-09T18:15:22.003522Z","submitted_at":"2025-08-28T20:02:10Z","title":"Mirage or Method? How Model-Task Alignment Induces Divergent RL Conclusions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:35:50.973056Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2508.21188"},"observation_digest":"sha256:aab8a381db15a449be06d508135a8ac3416b1c72a6f2858b561982ed1b6a3a51","observation_id":"44a3cdc7-cb6d-4f98-8329-29478b16b20e","resolution":{"observed_at":"2026-08-05T14:35:50.973056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":"2505.22653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-07-02T06:06:40.819064Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason","venue":null,"work_id":"6e345e0c-7c39-4e94-af60-56d7643c5704","year":2025},"citing_paper":{"arxiv_id":"2605.02909","last_updated":"2026-04-06T15:02:52Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-06T15:02:52Z","title":"Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T18:52:52.969408Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2605.02909"},"observation_digest":"sha256:641d1a533aa2417716ab4667f502d2769e1878b3466844a4321b97a58269b114","observation_id":"108954cf-c305-4ec2-8327-6849d809a05d","resolution":{"observed_at":"2026-05-10T23:45:53.070918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":"2505.22653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-07-02T06:06:40.819064Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason","venue":null,"work_id":"6e345e0c-7c39-4e94-af60-56d7643c5704","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-09T17:46:54.267669Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:a72ea291ba1540c83bfd596958f0d8f1e02ed80f45372c6799d704375fea6c99","observation_id":"8ebcca75-35d3-4ee1-87a0-82b75a9e79f3","resolution":{"observed_at":"2026-05-11T04:00:55.164977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":"2505.22653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-07-02T06:06:40.819064Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason","venue":null,"work_id":"6e345e0c-7c39-4e94-af60-56d7643c5704","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:1f2a2eb25eac72fd3fb8429d6a928cbd963af165af9ca1eaf409114e1951349b","observation_id":"b8673b48-961e-4c8e-a55e-11795d86cadd","resolution":{"observed_at":"2026-07-01T20:56:13.695124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"cited_work":{"arxiv_id":"2505.22653","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22653","snapshot_observed_at":"2026-07-02T06:06:40.819064Z","title":"The climb carves wisdom deeper than the summit: On the noisy rewards in learning to reason","venue":null,"work_id":"6e345e0c-7c39-4e94-af60-56d7643c5704","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2505.22653","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:3cd02ba93f1f05f0b92d83a1fcf883089bd71bab06c75695b73f527978d5c859","observation_id":"7a0e6b5b-8f8d-4cde-9b40-2fdff5e0c9b4","resolution":{"observed_at":"2026-07-02T06:06:40.820599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22653/citation-record","integrity":"/paper/2505.22653/integrity","json":"/paper/2505.22653/citation-record.json","paper":"/paper/2505.22653"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:20.774171Z","title":"Rethinking reflection in pre-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:20.774171Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:a86cdae426f615d5efce6e825133ccf4bb3d8fd3f39721e2d507bba63ba969fa","observation_id":"336360d1-d394-4743-b0ae-7be6a657ddb8","resolution":{"observed_at":"2026-08-07T13:08:20.774171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:30.015309Z","title":"Math- arena: Evaluating llms on uncontaminated math competitions, February 2025","venue":null,"work_id":"8efe7d89-3534-4303-8241-30c3a838ffa6","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:20.882511Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:55c76de6a333ac9f919f3dbd61dd4c438ec895e88d334e18e4d837083d4e53b0","observation_id":"cfee5b61-bfa2-41b1-8ec9-ebeaef0ecf13","resolution":{"observed_at":"2026-08-07T13:08:30.141674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:20.971903Z","title":"Do not think that much for 2+3=? on the overthinking of o1-like llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:20.971903Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:32638f393fdb9f2a35f5fe2f3ba7d16f38a539d63cd2ad4493c5b8d644108745","observation_id":"998bfda0-0c08-46be-aa8c-b9ec8d061431","resolution":{"observed_at":"2026-08-07T13:08:20.971903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.696547Z","title":"The accuracy paradox in RLHF: When better reward models don‘t yield better language models","venue":null,"work_id":"34f8e887-0568-4fae-b183-e1a3540b44d7","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:21.046797Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:18fa7c43efaeccbabfc0c3b0cd318c0d0a15d118c5f30783dddcfec9d4502ee2","observation_id":"dd4d2aa7-3ebd-4178-84e4-761d8bc8e0d7","resolution":{"observed_at":"2026-08-07T13:08:29.793026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.514602Z","title":"Fortify the shortest stave in attention: Enhancing context awareness of large language models for effective tool use","venue":null,"work_id":"1f6eff2a-ab69-4974-a825-1c2a6a1ef905","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:21.149444Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:90ef7f8f2aa7fb15cc97b5ee6327d683a0fe12aa4fa3d4b1f0cfb16eee060445","observation_id":"5cc1211e-9c9b-4cbe-a5b8-4b980717d800","resolution":{"observed_at":"2026-08-07T13:08:29.579980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:21.245093Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:21.245093Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:73a273c57176769968dc1a91df68f6b62903164ca9b18c64dbb53267ccf51321","observation_id":"fa6a6ec4-aa68-44e1-ae75-ea2c1ad58338","resolution":{"observed_at":"2026-08-07T13:08:21.245093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.393341Z","title":"Q*: Improving multi-step reasoning for LLMs with deliberative planning, 2024","venue":null,"work_id":"3f02ca3d-925a-4118-a5cf-ba3353301eaf","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:21.723778Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:21f914926772a31a2bba3e910832339f24d5466d60b716ec9748450b67d45556","observation_id":"2fbaa476-27b7-4e7f-a4ab-9f973e655974","resolution":{"observed_at":"2026-08-07T13:08:29.438633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.275125Z","title":"Fleiss et al","venue":null,"work_id":"0a34d256-73f2-4379-8590-e8c5b1829ff9","year":1971},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.439678Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:1b93022e1bb8175983437904242f93a8179aa957d7c332ba63543d0f59030d2b","observation_id":"3881cd0d-3e5b-43ba-989f-bbf78fe41ef5","resolution":{"observed_at":"2026-08-07T13:08:29.324041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:29.098944Z","title":"Angelopoulos, Jiantao Jiao, Banghua Zhu, Joseph E","venue":null,"work_id":"b628002a-cde5-4648-8766-002843b4547a","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.712573Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:a9aee82deccd8fd77a0ce28a88794fbeb759dca95c5cf2eba3545cf6ddfe74ea","observation_id":"2bca5e9a-1439-47f8-aaf6-7f87adf5a74b","resolution":{"observed_at":"2026-08-07T13:08:29.144749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:22.798068Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.798068Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:c688a628040ee31774aaec3e4897bd441b9d03f95b4b21dfe82db43fc3ea29d0","observation_id":"64d7804c-fb4f-41bd-872c-ca23e7ddd1b6","resolution":{"observed_at":"2026-08-07T13:08:22.798068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:28.873630Z","title":"Training large language models to reason in a continuous latent space, 2024","venue":null,"work_id":"74b4eb67-5e7b-4830-ac06-7f9165f29126","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.889241Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:410bfafb541b7180c6fe0036e00fea415032efcbb89572a40a7c00887e479cdc","observation_id":"bd96b21b-2804-4f67-adb6-7cb18f974884","resolution":{"observed_at":"2026-08-07T13:08:28.939096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:22.944756Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:22.944756Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:c46159bd27dabbf2aec05d1b5b6c08e769ee6c73a2b691e546924ca2fb7b21dc","observation_id":"635020b9-ad11-4fdd-af1a-d3fb2e407619","resolution":{"observed_at":"2026-08-07T13:08:22.944756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:23.015073Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.015073Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:16f464f24f494a018b51a5af5cfd1f0ca49455fe7b3c38b38e435a64dcf004a7","observation_id":"ee38baa9-bbe4-4dfd-88bb-1f454b229ffb","resolution":{"observed_at":"2026-08-07T13:08:23.015073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:28.664792Z","title":"Human-centric dialog training via offline reinforcement learning","venue":null,"work_id":"5d52306c-31a6-4097-b977-46a4639a30a3","year":2020},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.127945Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:f65c7d33ea8b494e133f3522b6cff794f0da1eb4a04d6a75d98bfd9334f39dfc","observation_id":"378ba01a-8ced-4322-ad0c-92e08e401e32","resolution":{"observed_at":"2026-08-07T13:08:28.733015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:28.421174Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":"ca3ffdec-3f77-4e17-b5ba-f656cf522d41","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.187072Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:05e052f14baa6e6efbd9a5bd99e4cf0f4bce7fa5c39f0217f7bcb40105f84a82","observation_id":"cca45cb9-7636-447b-b605-72d834896154","resolution":{"observed_at":"2026-08-07T13:08:28.526514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:28.236073Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms, 2024","venue":null,"work_id":"9af5f3a4-5b27-4029-9146-90330ce6a446","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.332664Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:417d14f3aad782d888c30a54c7a88033c3c9cff7f9b529efde64dc891f7115b8","observation_id":"a2855bad-a891-4e71-8de2-9b2da73099ff","resolution":{"observed_at":"2026-08-07T13:08:28.347936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:23.476989Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.476989Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:1ddebf45bd6d685f4b35129a95f573decdcf00b4da98481e569da8ff34c101a8","observation_id":"9c252d4a-6eba-44fc-8507-e4a48c7916b7","resolution":{"observed_at":"2026-08-07T13:08:23.476989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:27.974339Z","title":"RM-bench: Benchmarking reward models of language models with subtlety and style","venue":null,"work_id":"e145bf1f-31a3-4a4f-8b84-b7dbaeba5248","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.564975Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:7012668211b1585d20a65f3d9d241f6b3e79b6b65a0e4846da165593ab77f8f2","observation_id":"14cce726-7ded-4d3d-8c40-62737ca8a218","resolution":{"observed_at":"2026-08-07T13:08:28.032968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:23.664904Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.664904Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:20e0463a3c77b9362f4d7eee17b72c3bb3ff19ed5c1ce788d9215446b4e7e809","observation_id":"8f5711fa-ead4-4460-b00e-d306e59b5d64","resolution":{"observed_at":"2026-08-07T13:08:23.664904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:23.784375Z","title":"s1: Simple test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:23.784375Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:3fd67d20e18400566e7e82d7f96fadcff1ba1415b8af821fc487b0e23fef0f8b","observation_id":"08f18d02-a882-4f7a-be83-c2d6097de2ab","resolution":{"observed_at":"2026-08-07T13:08:23.784375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.224696Z","title":"Webgpt: Browser-assisted question-answering with human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.224696Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:fc2270fe16fc4d41036dfddf47f415457b93cf1fe08020514c211102aa037142","observation_id":"69dee594-ee21-4766-be72-8080c5d2b93d","resolution":{"observed_at":"2026-08-07T13:08:24.224696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.363161Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.363161Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:c24a08d2235cb921d41804ca6148e681f82c1e4faf077dbb7b6158ea016dbafd","observation_id":"10d11159-eb51-492b-9e73-18ce08a42abe","resolution":{"observed_at":"2026-08-07T13:08:24.363161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.515080Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.515080Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:f866cfec2ecb55d10831cc3af86c5d25188b642bd2e3341a931e5df9bff171d5","observation_id":"59acf32a-c8fb-4bb1-ae9e-927664cdeaf9","resolution":{"observed_at":"2026-08-07T13:08:24.515080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:27.564768Z","title":"Lee, and Sanjeev Arora","venue":null,"work_id":"d2cd5ba4-4272-467f-a79a-6c18b85adc4e","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.675041Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:2ad352616b5903bf0648d678d7ff9bfa04c235f3270c0a54a21508b07c870cf6","observation_id":"7d818213-3f27-4f53-bf0e-9dcb03f1d974","resolution":{"observed_at":"2026-08-07T13:08:27.645811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.812651Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.812651Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:c507efe7cbc42cc30052147a983865243d2cfcde3feaeac79d7baf9411e8ac1d","observation_id":"f037cab5-2d76-46dc-a77e-88e8f44d0696","resolution":{"observed_at":"2026-08-07T13:08:24.812651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:24.984971Z","title":"High- dimensional continuous control using generalized advantage estimation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:24.984971Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:55de92d88eaf6977d48397222e3daeb7a71dd8684253471eb49369d6494eab8b","observation_id":"9181ac7a-da72-464e-939f-190848bf5bc9","resolution":{"observed_at":"2026-08-07T13:08:24.984971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:25.215091Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.215091Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:a14b94c83bff34ebb1424f12efbb36e662dcbd49505f3b52f17de65a8d13dbd0","observation_id":"11c5364e-0c72-46a3-aeb0-994d299d28bb","resolution":{"observed_at":"2026-08-07T13:08:25.215091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T13:08:25.364234Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.364234Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:3e3e59505c79aec30be0f7eac9472cf3c80891a41740ede6f47764782b4a0401","observation_id":"f7c7bc53-22d7-49cc-9177-88a313d57cbe","resolution":{"observed_at":"2026-08-07T13:08:25.364234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:25.504871Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.504871Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:b85830e0011be2e9cd4c04d50f2c248b953aadad104e6e55c16d032255671dc2","observation_id":"4272dc37-bbc5-4ce1-aef3-aed663720f48","resolution":{"observed_at":"2026-08-07T13:08:25.504871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:27.243501Z","title":"Dedicated feedback and edit models empower inference- time scaling for open-ended general-domain tasks, 2025","venue":null,"work_id":"5cfcd3b9-2320-4c8e-8a8a-7156b4bf4bde","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.654842Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:aee12e3e397f70f7181890e3c60b3c210a4f061dc4dc0a80cdb988b299b23c9b","observation_id":"26abeed2-a18d-420c-9afd-e7d1a79adca9","resolution":{"observed_at":"2026-08-07T13:08:27.328579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:27.150606Z","title":"Rethinking reward model evaluation: Are we barking up the wrong tree? InThe Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"87a1159f-a1b1-405b-acae-387b8927eb9d","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.754909Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:419f5e07fafcb5042157049f5c403643a41b3568f48aa64baa65f9240ad50d0a","observation_id":"7b6fdd6e-43c2-4eb5-ae7c-4740d996a3fd","resolution":{"observed_at":"2026-08-07T13:08:27.187371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:08:25.864911Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.864911Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:b3e61daeebbea3455476d7179a61d9c8869c5d790d09cf3029114fdc9a4b226e","observation_id":"bea22113-c115-4ecd-812f-1e937335b71a","resolution":{"observed_at":"2026-08-07T13:08:25.864911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:25.962237Z","title":"Demystifying long chain-of-thought reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:25.962237Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:0fb33dba60cc710a4d8d4cde7c95fdb5f15537d55327f492346645e659cd79b8","observation_id":"ea6018df-d49a-4ef0-bbf8-b858be14404c","resolution":{"observed_at":"2026-08-07T13:08:25.962237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.027884Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.027884Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:bd7a67fbec013f6855f5aceedd3612563213bf5a6d5707d1ff81efb59c793952","observation_id":"a4b3b8f4-9604-4a7b-b586-b5d512a31f90","resolution":{"observed_at":"2026-08-07T13:08:26.027884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.063576Z","title":"ReST- MCTS*: LLM self-training via process reward guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.063576Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:958cb49245f88bfa15abf4f17a46d8a221f2394736bf7918191b0e6bc68ed3f5","observation_id":"9eb3e823-7347-465f-93b5-749aa9c69481","resolution":{"observed_at":"2026-08-07T13:08:26.063576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.918665Z","title":"Found in the middle: How language models use long contexts better via plug-and-play positional encoding, 2024","venue":null,"work_id":"d447d0d4-48b5-4b8b-883d-854fddb80f1e","year":2024},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.156253Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:831344895c732d3146285feabb61a8a984c26e19cc526c1a14a31c2e5514d842","observation_id":"7f4098c4-46f3-4d53-a169-68d533074504","resolution":{"observed_at":"2026-08-07T13:08:27.018577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.805467Z","title":"Rmb: Comprehensively benchmarking reward models in llm alignment, 2025","venue":null,"work_id":"4f0c0e6e-8dd3-407d-ab5e-3652cfb2fd6b","year":2025},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.285176Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:3358e6c0d6b91050ca147bff1e92ee2cf38fb990cea7336f3247e93dbdedca71","observation_id":"1396fc1a-f01e-4061-8aa8-07a35ce0d174","resolution":{"observed_at":"2026-08-07T13:08:26.853533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:26.574279Z","title":"Assistant:␣<think>","venue":null,"work_id":"653dc899-d411-4421-aaf8-77fceda89015","year":2023},"citing_paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:08:26.418982Z"},"links":{"citing_paper":"/paper/2505.22653"},"observation_digest":"sha256:db9067d3801be91537271d29b9d8aacc73f13394b2d3d74fa9ff30da30b4b688","observation_id":"a4ece631-7ac0-429d-88eb-33ba21a03c33","resolution":{"observed_at":"2026-08-07T13:08:26.655809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.22653","last_updated":"2025-05-28T17:59:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T17:02:45.624786Z","submitted_at":"2025-05-28T17:59:03Z","title":"The Climb Carves Wisdom Deeper Than the Summit: On the Noisy Rewards in Learning to Reason"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 7 inbound Pith citation observations for arXiv:2505.22653."}