{"as_of":"2026-08-15T19:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a728d9f9a1cc20088f0aa15333bda2ad5af89234e438745618a01adcaba285e","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:38:50.332584Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:32:55.155806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T06:47:28.400784Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-08-05T23:32:55.155806Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05282","last_updated":"2026-07-21T08:08:53Z","snapshot_observed_at":"2026-08-13T15:11:14.520184Z","submitted_at":"2025-08-07T11:26:40Z","title":"Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T23:32:55.155806Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2508.05282"},"observation_digest":"sha256:dac5e57ac908aac21863c070a07823f5da52c0065e113948a84eccf2f0abe890","observation_id":"4bdfda50-1c54-4dda-9721-25b4f9f42947","resolution":{"observed_at":"2026-08-05T23:32:55.155806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2505.14391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the first error: Process reward models for reflective mathematical reasoning","venue":null,"work_id":"e86db5eb-3c66-44bc-b5ec-912012f65733","year":2025},"citing_paper":{"arxiv_id":"2604.02341","last_updated":"2026-02-08T06:38:20Z","snapshot_observed_at":"2026-08-11T14:52:00.824484Z","submitted_at":"2026-02-08T06:38:20Z","title":"LLM Reasoning with Process Rewards for Outcome-Guided Steps","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T06:43:19.869111Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2604.02341"},"observation_digest":"sha256:cd451bfc1aa659b424a27cc522b9b32259122861157040398956aafb05bda24b","observation_id":"7e729a3c-92e4-4d7c-a159-81f0384848bf","resolution":{"observed_at":"2026-05-16T06:47:28.403595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2505.14391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the first error: Process reward models for reflective mathematical reasoning","venue":null,"work_id":"e86db5eb-3c66-44bc-b5ec-912012f65733","year":2025},"citing_paper":{"arxiv_id":"2605.04064","last_updated":"2026-04-10T21:13:46Z","snapshot_observed_at":"2026-08-11T04:56:00.431645Z","submitted_at":"2026-04-10T21:13:46Z","title":"Improving Medical VQA through Trajectory-Aware Process Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:18:17.846140Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2605.04064"},"observation_digest":"sha256:dfb25fb98d55e206300ef62cc023065b16a8eb49387576a2e81e85e71ab500fc","observation_id":"fe7a82cc-eca3-4c9f-bacd-f3766a158e7b","resolution":{"observed_at":"2026-05-11T07:06:06.051115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2505.14391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the first error: Process reward models for reflective mathematical reasoning","venue":null,"work_id":"e86db5eb-3c66-44bc-b5ec-912012f65733","year":2025},"citing_paper":{"arxiv_id":"2605.05226","last_updated":"2026-05-23T13:20:07Z","snapshot_observed_at":"2026-08-11T12:30:16.051529Z","submitted_at":"2026-04-19T10:33:19Z","title":"Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:09.898530Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2605.05226"},"observation_digest":"sha256:049ad1a296cd1f3765c45826dfc6e3d4f63825a059bc1e00017f6f4760323440","observation_id":"16ffdba1-42f0-4c17-8c90-bd1ee5a4ba35","resolution":{"observed_at":"2026-05-10T06:26:27.809955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2505.14391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14391","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the first error: Process reward models for reflective mathematical reasoning","venue":null,"work_id":"e86db5eb-3c66-44bc-b5ec-912012f65733","year":2025},"citing_paper":{"arxiv_id":"2605.13467","last_updated":"2026-05-13T12:55:18Z","snapshot_observed_at":"2026-08-12T16:10:37.480335Z","submitted_at":"2026-05-13T12:55:18Z","title":"PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T19:20:32.435135Z"},"links":{"cited_paper":"/paper/2505.14391","citing_paper":"/paper/2605.13467"},"observation_digest":"sha256:bf3a17f031c977ac96375c52cc1a9e29f205b7908176d081b0fd1c8c1776848d","observation_id":"e49ff7ad-a288-4b99-92e4-8b31bf123d1c","resolution":{"observed_at":"2026-05-14T19:22:50.477238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14391/citation-record","integrity":"/paper/2505.14391/integrity","json":"/paper/2505.14391/citation-record.json","paper":"/paper/2505.14391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.491408Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:45.491408Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:2655bfb441a86f3b5ce76a0139689771a8ce79c647d865b61ffd9e1c9f08eeda","observation_id":"56ea353b-2cf6-437e-a849-016d3e2fb7b9","resolution":{"observed_at":"2026-08-07T15:38:45.491408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.646682Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:45.646682Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:4c782775a10e728cdcfe8dbc81f7817560e64bc5adf5a56fbed6fa0616158875","observation_id":"5ba3d376-3125-4cb4-bef0-b951c523e66b","resolution":{"observed_at":"2026-08-07T15:38:45.646682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T15:38:45.810278Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:45.810278Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:e1599c39e05db96a6410c8fe23d9774909157d0cd13e285065e2cbf079cb4de4","observation_id":"99ca64c4-e157-473c-9c38-c563923aad0b","resolution":{"observed_at":"2026-08-07T15:38:45.810278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03553","last_updated":"2024-09-27T08:16:28Z","snapshot_observed_at":"2026-08-13T05:12:36.538689Z","submitted_at":"2024-05-06T15:20:30Z","title":"AlphaMath Almost Zero: Process Supervision without Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03553","snapshot_observed_at":"2026-08-07T15:38:45.934365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:45.934365Z"},"links":{"cited_paper":"/paper/2405.03553","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:e2e903be0632b3bd2c921c8afe7d588c70eac5ebff916b825fb7ffa3b86ff132","observation_id":"e6f6a7e9-f55a-4881-9803-c1929b3d812e","resolution":{"observed_at":"2026-08-07T15:38:45.934365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:38:46.053508Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.053508Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:3b4b056400c181d71140d70bca205c7b879cb578b0a687fb9b848170fa043413","observation_id":"2913f427-467c-4a51-9ead-0fd50fbf8d14","resolution":{"observed_at":"2026-08-07T15:38:46.053508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:38:46.198208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.198208Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:1a6f34938aa1f8b61d5a0e5de8693b7d557e0aea1ceb5c8b0b8ee42774cff9b5","observation_id":"60664621-518a-454d-9e7e-1498e3ce7270","resolution":{"observed_at":"2026-08-07T15:38:46.198208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-13T15:51:09.618005Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-07T15:38:46.337373Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.337373Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:fa6ca9a39ca6bfccf0fc74ffa68a7a88e7db2a579d6189161b1c7e9077e827f9","observation_id":"a605f1c9-900b-4e70-878d-96b1991697b1","resolution":{"observed_at":"2026-08-07T15:38:46.337373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:38:46.503915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.503915Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:a2b3bdefaecd1fc45988a791fab5ad9a0fd2d43ba4f9e24829a95d0ce0f68ca4","observation_id":"06c8340c-dd92-4d0b-98e8-fbecc9948eeb","resolution":{"observed_at":"2026-08-07T15:38:46.503915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T15:38:46.642136Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.642136Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:8be53678bbc62036b02b395171fec5ecb143073b033d2f683eb18a83ebf68e0c","observation_id":"c1bbf3ff-8196-4307-b5f3-6b2c0075e88a","resolution":{"observed_at":"2026-08-07T15:38:46.642136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:38:46.750931Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.750931Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:3544098fdb3d1d621174575043be6927bca5036b81ef35746a2af5c1343fb75d","observation_id":"16e8b4a0-21bc-41e3-a6cc-843eb4a2c98c","resolution":{"observed_at":"2026-08-07T15:38:46.750931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.889283Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:46.889283Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:afe8c34792960a1a5efa508e6633ae6bcf87e6daea2b38e351a8e9d5cd4b9acc","observation_id":"1dbca456-136a-40dc-9da3-d3c8609eb920","resolution":{"observed_at":"2026-08-07T15:38:46.889283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-08-13T18:02:27.155379Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-07T15:38:47.040946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.040946Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:fa56496f26006eb42b2ab931362c3c466e1bbcb3cd65e9f973d053fd992271c4","observation_id":"6a2055b3-5ad8-4212-9f18-dd114fb85d6a","resolution":{"observed_at":"2026-08-07T15:38:47.040946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T15:38:47.152880Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.152880Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:c9ea84d09f68a847511f5358199af26bb42d3a863d1b6c2a52c6f27533be9eae","observation_id":"4f78a47e-f84a-49b0-a976-e0dae7057545","resolution":{"observed_at":"2026-08-07T15:38:47.152880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09003","last_updated":"2024-12-16T06:13:03Z","snapshot_observed_at":"2026-08-14T11:26:41.766607Z","submitted_at":"2024-01-17T06:48:16Z","title":"Augmenting Math Word Problems via Iterative Question Composing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09003","snapshot_observed_at":"2026-08-07T15:38:47.312631Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.312631Z"},"links":{"cited_paper":"/paper/2401.09003","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:721b2f65ec63c684b107559cb65513ec008a8fa4a3e140424ff00f90c55a2981","observation_id":"eb3f3a78-6ed7-4ae3-8649-6891effedeb9","resolution":{"observed_at":"2026-08-07T15:38:47.312631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.463728Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.463728Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:098280f36561bd52da13bdf9da733e47810ff6c27628868aa87a7577649271e5","observation_id":"8a944585-18f4-4afa-b251-22318ae3ad1c","resolution":{"observed_at":"2026-08-07T15:38:47.463728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T15:38:47.611667Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.611667Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:c26d2efd59bd47fb78c301223f8ef400ae03ac648a6faa01698e579d7d231971","observation_id":"41a83954-97b4-4a1c-b509-692ce2a2caf9","resolution":{"observed_at":"2026-08-07T15:38:47.611667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.786178Z","title":null,"venue":null,"work_id":"38858aed-cc08-4ec8-b2f8-07e703a26193","year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.742752Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:032199b7668f329a8d9eda754b7f96a7ca23a560b84cc5ed1e7bc32245526f3c","observation_id":"f06f3f27-1078-4c93-ab80-8998c3a269fd","resolution":{"observed_at":"2026-08-07T15:38:51.846806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-08-14T19:09:59.262526Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T15:38:47.858019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.858019Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:06f85c08c8f1e4f830f5583afb3af0b4f627e59b45bdd9514f08f131c23c65eb","observation_id":"c24a8b09-f2c4-4ca0-bcaf-e6991b214e00","resolution":{"observed_at":"2026-08-07T15:38:47.858019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-14T11:38:51.383664Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T15:38:47.943305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:47.943305Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:4d960691404cd5a7e5f23714f914fb122cdb7edf22b7febd22094c71d6ded276","observation_id":"5b37e09c-c8cb-43dd-b03e-b0f7df8d9fea","resolution":{"observed_at":"2026-08-07T15:38:47.943305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.144397Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.144397Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:be6463740a98abccf783d3c4008148600ac7c02c31f97556d80764498b0d401c","observation_id":"3acdf7a3-f627-4f9a-9956-ffd8bdd99dbb","resolution":{"observed_at":"2026-08-07T15:38:48.144397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.528188Z","title":null,"venue":null,"work_id":"e2a55f54-6ccc-45d6-a721-f35331fb97bb","year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.277073Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:56a99ebcc6d31a8219789197491c11f5a7ff74a1d1467509d90504e421d6083e","observation_id":"c5437f33-0c61-4f58-ad92-432aa0b5a7c4","resolution":{"observed_at":"2026-08-07T15:38:51.712051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15797","last_updated":"2024-12-20T11:14:29Z","snapshot_observed_at":"2026-08-15T12:00:51.159853Z","submitted_at":"2024-12-20T11:14:29Z","title":"Ensembling Large Language Models with Process Reward-Guided Tree Search for Better Complex Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15797","snapshot_observed_at":"2026-08-07T15:38:48.422552Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.422552Z"},"links":{"cited_paper":"/paper/2412.15797","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:78e4cc448e3c0ae73d82eeca167ceea4657c101be03fee09795464a03c51d476","observation_id":"326fe5bc-3c46-494f-8c9c-400f7d0fc181","resolution":{"observed_at":"2026-08-07T15:38:48.422552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T15:38:48.565575Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.565575Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:ad6ee49db51c71730f78b7534da5fe3d4e5b2ceec90059c9e37fd260c410f498","observation_id":"e003c48c-8e24-486b-a8ce-5a086ee337bd","resolution":{"observed_at":"2026-08-07T15:38:48.565575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T15:38:48.738925Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.738925Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:ddac0f4c174c0e3f1047aae84ed3d67d6563d1de25f465657ba9c31b823ce5b0","observation_id":"3a7b88cd-be1a-4b3a-bf1a-3897f50274cc","resolution":{"observed_at":"2026-08-07T15:38:48.738925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T15:38:48.946473Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:48.946473Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:8e8ada742346887c995dad9f2807067e715540c481ca82792009b813e041ffab","observation_id":"fc93cedd-75b4-4182-8da9-3dd5f9219ee9","resolution":{"observed_at":"2026-08-07T15:38:48.946473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.334672Z","title":null,"venue":null,"work_id":"59ec2628-e4f2-4448-8bb4-a45a9b613e1c","year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.158853Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:e60cac8d0f6e4acbc827a3924ad3e2a1ec6daf413825d864aef49154344ecbc6","observation_id":"ca3e96b9-940b-4df8-8af2-26d93ae340af","resolution":{"observed_at":"2026-08-07T15:38:51.448514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.104796Z","title":null,"venue":null,"work_id":"e37c1adc-8345-43ec-bc22-de1edc23404e","year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.306606Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:cad3da59ae06b0ee09fc9c5b6989045d4b631c28fc490aba9d304efef119dc92","observation_id":"a30162a0-c2bd-4ab1-9c0c-bbce5076f09d","resolution":{"observed_at":"2026-08-07T15:38:51.195028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.425108Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.425108Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:4ed69fc152474e35941cb5e0f5cdf911f898de873e6c71db4eaf473bf6659e46","observation_id":"5eab2423-d5b3-4a0d-be5b-c291cdbcc078","resolution":{"observed_at":"2026-08-07T15:38:49.425108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:38:49.624831Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.624831Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:ccaa7a0d9496011845fe3f4c6aaab06d63ac7002dedd0b20f7da46c021a2173f","observation_id":"abf49cd1-0d55-431d-8f3f-9634012cd3ee","resolution":{"observed_at":"2026-08-07T15:38:49.624831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T15:38:49.778223Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.778223Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:19fdf3772bdd0bff45f9305d20509852b78bc12dd7f1856e9bd3cc0316755139","observation_id":"fbafd562-03d0-411e-8ae2-bf6c467f52eb","resolution":{"observed_at":"2026-08-07T15:38:49.778223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.874379Z","title":null,"venue":null,"work_id":"c1c6623b-5821-45ee-9ea5-2fd03bd861af","year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.897802Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:92970a62c63be9bbc4a4b9f44fd0d074bfc46b48df9322bfcde01987bb9a76f2","observation_id":"64034c53-e4af-46bc-87c3-a756aa20b3df","resolution":{"observed_at":"2026-08-07T15:38:50.970290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02658","last_updated":"2024-10-14T19:33:00Z","snapshot_observed_at":"2026-08-13T04:27:10.122155Z","submitted_at":"2024-02-05T00:57:51Z","title":"Multi-step Problem Solving Through a Verifier: An Empirical Analysis on Model-induced Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02658","snapshot_observed_at":"2026-08-07T15:38:49.957959Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:49.957959Z"},"links":{"cited_paper":"/paper/2402.02658","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:9713c0aa8acef84a7aea929df2a1960e103986f9bff207d9c8ec03f097cecfdd","observation_id":"c9c70a28-981a-443c-b618-94a132a8e05b","resolution":{"observed_at":"2026-08-07T15:38:49.957959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.036904Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.036904Z"},"links":{"citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:f4a6d33c8ee5dfe7e9d06daa0bc462bb8e17616e9b4416148fed9e881f16f905","observation_id":"4d06186d-a39e-4144-ba60-7034a482949e","resolution":{"observed_at":"2026-08-07T15:38:50.036904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03816","last_updated":"2024-11-18T05:36:16Z","snapshot_observed_at":"2026-08-14T03:57:25.019190Z","submitted_at":"2024-06-06T07:40:00Z","title":"ReST-MCTS*: LLM Self-Training via Process Reward Guided Tree Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03816","snapshot_observed_at":"2026-08-07T15:38:50.099971Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.099971Z"},"links":{"cited_paper":"/paper/2406.03816","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:d2c9b084602386c1e3f3c7f1d3c9e780b229fee8b9c3461e192643946d4d1095","observation_id":"5ab26c4c-3faf-40a7-a2b6-f62068ae0116","resolution":{"observed_at":"2026-08-07T15:38:50.099971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T15:38:50.179847Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.179847Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:fefeb87eaacbad83a67b8228e57440d6234d0f43eea6278ec670d588679b1d3b","observation_id":"53065805-6222-4cb9-827c-c369526c799f","resolution":{"observed_at":"2026-08-07T15:38:50.179847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-08-07T15:38:50.251756Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.251756Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:0c0ed89095b3be43192900c644e4253f58da2e6c0cfb2ffabe1f077402907571","observation_id":"630a15a5-4fd0-4948-9489-2af1c8d60d94","resolution":{"observed_at":"2026-08-07T15:38:50.251756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-14T07:02:14.518172Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-07T15:38:50.332584Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:38:50.332584Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2505.14391"},"observation_digest":"sha256:cc651cded72b65f9ce45cdeabd16352f2485f6f0272769fb2a402282134e356f","observation_id":"32fdfd0e-e858-4043-823d-a09a5e0bef91","resolution":{"observed_at":"2026-08-07T15:38:50.332584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14391","last_updated":"2025-05-20T14:12:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T16:59:40.688883Z","submitted_at":"2025-05-20T14:12:05Z","title":"Beyond the First Error: Process Reward Models for Reflective Mathematical Reasoning"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 5 inbound Pith citation observations for arXiv:2505.14391."}