{"as_of":"2026-08-14T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e025903bf19b696e7a3d8f7b47cc92505a79c1c60d17c48f2138a52132b072ed","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:21.519840Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:58:49.973078Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T14:53:06.955702Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19706","snapshot_observed_at":"2026-08-05T22:58:49.973078Z","title":"arXiv:2505.19706","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06124","last_updated":"2025-08-08T08:43:24Z","snapshot_observed_at":"2026-08-08T14:46:37.801934Z","submitted_at":"2025-08-08T08:43:24Z","title":"AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:49.973078Z"},"links":{"cited_paper":"/paper/2505.19706","citing_paper":"/paper/2508.06124"},"observation_digest":"sha256:a4e0e330136049a4efe6315cdd7a35d37ae74a7434792a202823122b9a8e4888","observation_id":"a1b42452-0fdc-42ee-af57-006b3dd497e1","resolution":{"observed_at":"2026-08-05T22:58:49.973078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"cited_work":{"arxiv_id":"2505.19706","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19706","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Error typing for smarter rewards: Improving process reward models with error-aware hierarchical supervision","venue":null,"work_id":"5d3a1715-36ab-44d6-952f-2511df74f984","year":2025},"citing_paper":{"arxiv_id":"2605.15529","last_updated":"2026-05-15T01:57:11Z","snapshot_observed_at":"2026-08-13T10:12:14.745388Z","submitted_at":"2026-05-15T01:57:11Z","title":"Process Rewards with Learned Reliability","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T14:51:13.966538Z"},"links":{"cited_paper":"/paper/2505.19706","citing_paper":"/paper/2605.15529"},"observation_digest":"sha256:661e568de920dcda3299d8d501a6c52c45cb5130b92e2039079c8b58105bc29c","observation_id":"bc392757-c65a-47c2-ae0a-5adced636e00","resolution":{"observed_at":"2026-05-19T14:53:06.957200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19706/citation-record","integrity":"/paper/2505.19706/integrity","json":"/paper/2505.19706/citation-record.json","paper":"/paper/2505.19706"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:18.968255Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:18.968255Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:9711b28e39e2846b0791a0e8947159df190240f88f1ad1f65b7ec72ebf8b2b62","observation_id":"b5c6f086-183d-422b-a08b-8f31bb64ebc8","resolution":{"observed_at":"2026-08-07T14:14:18.968255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:14:19.156320Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.156320Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:8dd1621e4d6700f1fb89bd2e6e4a5fc33bd85da76185c5822d25fb17f39da40e","observation_id":"6d751b58-6292-4e64-b21a-6bb4a7c6ffe9","resolution":{"observed_at":"2026-08-07T14:14:19.156320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:19.237664Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.237664Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:9d42a3435ad2d2032f48ac6a553d58b3c94f51075baa2e621b134f8e68ed0078","observation_id":"5011179a-17b5-44e5-85fa-4f9aeb89f488","resolution":{"observed_at":"2026-08-07T14:14:19.237664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-11T17:22:43.545531Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T14:14:19.319766Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.319766Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:cfede25fec3e98b1565a3b521f3a88c96660b24a919cad4aab7e278674b0bd7c","observation_id":"2adfa8dd-79b8-4883-979a-77031df66ba4","resolution":{"observed_at":"2026-08-07T14:14:19.319766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06703","last_updated":"2025-02-10T17:30:23Z","snapshot_observed_at":"2026-08-08T18:40:06.157350Z","submitted_at":"2025-02-10T17:30:23Z","title":"Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06703","snapshot_observed_at":"2026-08-07T14:14:19.428465Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.428465Z"},"links":{"cited_paper":"/paper/2502.06703","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:a712b2e6017cb0bf6aab7154132c7330bf7c6dcfc79a15c71f2c21d337f3ee7e","observation_id":"c9834023-d4e3-4163-b2fb-b9b35d000c63","resolution":{"observed_at":"2026-08-07T14:14:19.428465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-07T14:14:19.554437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.554437Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:e6fd17d2e69a8dcae0ee820043a3452a69d5a549e6deed4459bf68e834666d32","observation_id":"efd378be-ec6a-4293-9a0f-93cb4fb7e8f6","resolution":{"observed_at":"2026-08-07T14:14:19.554437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.935050Z","title":null,"venue":null,"work_id":"7acc6ee9-89f5-4413-b4b8-987b8efe2b43","year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.674351Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:3cd23113bddd6a0a778dac25912c185a97e427654895d7ffd809ac0c3157fa5c","observation_id":"8513cbaa-decc-4914-953b-2c653543a98a","resolution":{"observed_at":"2026-08-07T14:14:22.011172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.768755Z","title":null,"venue":null,"work_id":"d9ee9623-6fd0-4a87-8d89-e36e667124b0","year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.783614Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:2e7f3b4842e657313b6a58af12d7d62fac1617d002255dfb61c80222caefd3ec","observation_id":"b66f5c06-a081-477e-87d8-c6ef3911f85e","resolution":{"observed_at":"2026-08-07T14:14:21.835635Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21295","last_updated":"2025-03-27T09:23:08Z","snapshot_observed_at":"2026-08-12T14:14:10.083222Z","submitted_at":"2025-03-27T09:23:08Z","title":"R-PRM: Reasoning-Driven Process Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21295","snapshot_observed_at":"2026-08-07T14:14:19.876368Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.876368Z"},"links":{"cited_paper":"/paper/2503.21295","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:bc879bb4ede859c579629634ceaad434def3855bed1fa22594423a65fddc4336","observation_id":"a86bc2bd-c4a8-4c07-8e90-39319c29e13c","resolution":{"observed_at":"2026-08-07T14:14:19.876368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-10T21:50:50.009823Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-07T14:14:19.989779Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:19.989779Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:adb7cce92cb31ad94d046c39524aaa86ced09f80c6baff9d94fc91bb5706342d","observation_id":"58760b42-ef1c-4624-b54b-aa01c9a01cad","resolution":{"observed_at":"2026-08-07T14:14:19.989779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09472","last_updated":"2024-12-10T08:54:09Z","snapshot_observed_at":"2026-08-13T00:54:12.634757Z","submitted_at":"2024-03-14T15:12:38Z","title":"Easy-to-Hard Generalization: Scalable Alignment Beyond Human Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09472","snapshot_observed_at":"2026-08-07T14:14:20.136880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.136880Z"},"links":{"cited_paper":"/paper/2403.09472","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:9f3a6361e5cec01dbe127aa9001df46bfc5966a6a3ea92bc4f9ba1551ba933c6","observation_id":"56a5b2ec-712a-4545-8dd9-8ba54ba819fc","resolution":{"observed_at":"2026-08-07T14:14:20.136880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11520","last_updated":"2025-02-17T07:41:27Z","snapshot_observed_at":"2026-08-14T09:12:30.467498Z","submitted_at":"2025-02-17T07:41:27Z","title":"AURORA:Automated Training Framework of Universal Process Reward Models via Ensemble Prompting and Reverse Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11520","snapshot_observed_at":"2026-08-07T14:14:20.254758Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.254758Z"},"links":{"cited_paper":"/paper/2502.11520","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:b356842b7bb4303cf05fa0a90ade850eb33e65560dc268954efd0e3680910907","observation_id":"88c8303b-0f73-4d43-88c7-98bc4cfb0d3d","resolution":{"observed_at":"2026-08-07T14:14:20.254758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-07T14:14:20.364504Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.364504Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:72ff2b7a8ede076b0b988a6994683f512ad48f0132073800738c0d982bf6f9dd","observation_id":"b52878ae-1e85-4ec6-9057-86ea82c1a8c9","resolution":{"observed_at":"2026-08-07T14:14:20.364504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-12T22:24:37.331657Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-08-07T14:14:20.522619Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.522619Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:089f0e46d013311a30ad8774bcac990dc9b50d7cefef034dd289e1cc77d131a3","observation_id":"879e5c96-25ab-4a97-b84f-7b061a93b65f","resolution":{"observed_at":"2026-08-07T14:14:20.522619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:20.610933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.610933Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:93ff6a25fd4bd80f5be8f5f0faa528f0b3b93948a8601e9cf0756e9af5918830","observation_id":"89155cee-1c19-481b-823d-169683158bd1","resolution":{"observed_at":"2026-08-07T14:14:20.610933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T14:14:20.694287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.694287Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:ad474e0baacf4787f1cdcd2baa234084623b8f0d7c247aa797680a37c99f7fa4","observation_id":"55b9c388-e4ae-40c2-8c1a-b682b88306f3","resolution":{"observed_at":"2026-08-07T14:14:20.694287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:20.773480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.773480Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:1bb45acf34860f7f2afbbf885c784425512c241e4289bdea1ee7444ac89a7de9","observation_id":"c640f3d6-9084-40a9-a532-b9e2b78e8fd3","resolution":{"observed_at":"2026-08-07T14:14:20.773480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:20.861017Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.861017Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:d58ecbfac8d64e53d8be41cc57d85308640578367efb4e167de3e11f110115c9","observation_id":"cd0f8c5f-24aa-41c6-a3e4-cdccf5033517","resolution":{"observed_at":"2026-08-07T14:14:20.861017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:20.931464Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:20.931464Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:66ca06ce07aaf7bd454cbac9302fb40c229068a2860d6d8edc98569587ff9728","observation_id":"ba321121-99fe-4196-8d6d-d1a4d1c5fce0","resolution":{"observed_at":"2026-08-07T14:14:20.931464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.023530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.023530Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:7d71094489812c7a604a4b8bf8c9b3f20486ecbd3b1f16f9af9a25b01cdd161b","observation_id":"828d72b4-303a-42e1-bcc8-3f04d1b990c8","resolution":{"observed_at":"2026-08-07T14:14:21.023530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-13T17:31:32.138475Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T14:14:21.092331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.092331Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:bf366adf37b4e64b2ee2d42771afe3a24e953248131cabb417b9cd9eb29f9eab","observation_id":"9120d802-a4f3-4240-ba10-d949d515721a","resolution":{"observed_at":"2026-08-07T14:14:21.092331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T14:14:21.168455Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.168455Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:77dea382bdceca36a930ca5583773e38191da7bf72f91609d6d73f8b139c0fb5","observation_id":"85eae2ab-d0f4-483b-9e3f-d46c1d24eeb0","resolution":{"observed_at":"2026-08-07T14:14:21.168455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00891","last_updated":"2025-04-05T03:04:37Z","snapshot_observed_at":"2026-08-13T05:58:50.073773Z","submitted_at":"2025-04-01T15:21:05Z","title":"GenPRM: Scaling Test-Time Compute of Process Reward Models via Generative Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00891","snapshot_observed_at":"2026-08-07T14:14:21.245461Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.245461Z"},"links":{"cited_paper":"/paper/2504.00891","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:42df6510c748149adc331d8c2220d30c324b206818c29a1330a7837639ff780a","observation_id":"0606978e-3802-4f8d-be98-70a2a53d2731","resolution":{"observed_at":"2026-08-07T14:14:21.245461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-14T07:02:14.518172Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-07T14:14:21.314240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.314240Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:d166d45bc0f2b3f36f4a5a7c88ff49b1281afc8613456b68e6569663d2ec553a","observation_id":"54282e4b-965d-4c47-8922-efafabd17d13","resolution":{"observed_at":"2026-08-07T14:14:21.314240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.388599Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.388599Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:3462725f6f4cc3f8afa09a9a7ffe28a62e5bc3170efd1a3cf6215015b5f3119a","observation_id":"c8b28158-9ba8-4576-bf51-3fbe86659bd2","resolution":{"observed_at":"2026-08-07T14:14:21.388599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:21.519840Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:21.519840Z"},"links":{"citing_paper":"/paper/2505.19706"},"observation_digest":"sha256:c4f03bd69428c6d0c1c6668426722e4a3f0ed5ae3ba11ed6c730ad680a9664ae","observation_id":"c2acf720-a52c-4464-9441-157725fd18b0","resolution":{"observed_at":"2026-08-07T14:14:21.519840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19706","last_updated":"2025-05-26T08:56:36Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T09:19:22.523986Z","submitted_at":"2025-05-26T08:56:36Z","title":"Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2505.19706."}