{"as_of":"2026-08-10T01:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9cf0c9160786c40725ec9c7ca36c8d9ffebc10bcf3c13e36610a11318169344","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:49:48.914469Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:14:17.376888Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.335126Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09884","snapshot_observed_at":"2026-08-06T15:14:17.376888Z","title":"Li, Y .; Chen, X.; Hu, B.; Wang, L.; Shi, H.; and Zhang, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16878","last_updated":"2025-07-22T12:29:13Z","snapshot_observed_at":"2026-08-09T16:03:32.935657Z","submitted_at":"2025-07-22T12:29:13Z","title":"CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:14:17.376888Z"},"links":{"cited_paper":"/paper/2507.09884","citing_paper":"/paper/2507.16878"},"observation_digest":"sha256:103b11df2dac1303c3c9429f64197e86d75edd4d649ca4d30d944a29a75f6a23","observation_id":"7ba920d1-40c7-412f-9313-65550a564233","resolution":{"observed_at":"2026-08-06T15:14:17.376888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"cited_work":{"arxiv_id":"2507.09884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09884","snapshot_observed_at":"2026-07-01T20:56:13.335126Z","title":"Verifybench: A systematic benchmark for evaluating reasoning verifiers across domains","venue":null,"work_id":"901f1726-1a8d-457d-96c3-40dcb729f89f","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-02T22:13:21.681005Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2507.09884","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:75a3ac442bde076a5aa49012502364d60694d3665d3b7daaff2083d7ea256f60","observation_id":"0f8dab58-f029-481f-9742-466f818d888a","resolution":{"observed_at":"2026-05-25T07:40:28.733858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"cited_work":{"arxiv_id":"2507.09884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09884","snapshot_observed_at":"2026-07-01T20:56:13.335126Z","title":"Verifybench: A systematic benchmark for evaluating reasoning verifiers across domains","venue":null,"work_id":"901f1726-1a8d-457d-96c3-40dcb729f89f","year":2025},"citing_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T10:15:37.280308Z"},"links":{"cited_paper":"/paper/2507.09884","citing_paper":"/paper/2605.19196"},"observation_digest":"sha256:bc6d1f8749bfac7616e6624f8ddf979367c147e9aa4d0a078f3e82c03ce757f3","observation_id":"3e09ee99-d4ad-46ba-9b71-fb408140785a","resolution":{"observed_at":"2026-05-20T10:18:11.800374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"cited_work":{"arxiv_id":"2507.09884","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.09884","snapshot_observed_at":"2026-07-01T20:56:13.335126Z","title":"Verifybench: A systematic benchmark for evaluating reasoning verifiers across domains","venue":null,"work_id":"901f1726-1a8d-457d-96c3-40dcb729f89f","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.09884","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:b4698cf710b04eff031fc8b3ab8550048b524a42283db14136a331c6cde05852","observation_id":"fd70d5cb-8af4-46aa-a475-520df2530179","resolution":{"observed_at":"2026-07-01T20:56:13.336641Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.09884","snapshot_observed_at":"2026-07-14T02:43:21.225324Z","title":"Verifybench: Benchmarking verifiers for expert-level reasoning.CoRR, abs/2507.09884, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11849","last_updated":"2026-07-13T17:38:22Z","snapshot_observed_at":"2026-07-16T23:20:03.329744Z","submitted_at":"2026-07-13T17:38:22Z","title":"AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T02:43:21.225324Z"},"links":{"cited_paper":"/paper/2507.09884","citing_paper":"/paper/2607.11849"},"observation_digest":"sha256:8b6a0eeb8abffa17b22268fe83849be36efd799c45bddf162a2058777b10d4f8","observation_id":"6946d62b-d7f5-4cf7-9ccc-2c5d8933f80b","resolution":{"observed_at":"2026-07-14T02:43:21.225324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.09884/citation-record","integrity":"/paper/2507.09884/integrity","json":"/paper/2507.09884/citation-record.json","paper":"/paper/2507.09884"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:49:48.855844Z","title":"Guo, D.; Yang, D.; Zhang, H.; Song, J.; Zhang, R.; Xu, R.; Zhu, Q.; Ma, S.; Wang, P.; Bi, X.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.855844Z"},"links":{"citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:19c2b1c2180af86a4952dd768089506653696a562d19168c04682a7e76b2418e","observation_id":"bb442253-fcea-468d-81fe-3f37eab76454","resolution":{"observed_at":"2026-08-06T17:49:48.855844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T17:49:48.860372Z","title":"arXiv preprint arXiv:2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.860372Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:a0ae7dd31753b4f6188bee591efc3c3d93c7111941ee79d986ba123054626cb0","observation_id":"fa6af1dc-9e46-4735-a120-40a330f4e73c","resolution":{"observed_at":"2026-08-06T17:49:48.860372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-06T17:49:48.868873Z","title":"arXiv preprint arXiv:2503.24290","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.868873Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:85a4a3c19cb56fad15ef5a7acb719bd145054e1f8416d4349aa7b5b3662d389b","observation_id":"ccd24738-1a77-4728-b482-f0c4c7ae23b0","resolution":{"observed_at":"2026-08-06T17:49:48.868873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:49:48.873402Z","title":"arXiv preprint arXiv:2505.22203","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.873402Z"},"links":{"citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:541eeddd84046f66ec6b8357bf37f2c69f1e6ab606aa378df4fe94d73f5d9c8d","observation_id":"ec0af700-209c-4b75-95d1-4d7e4594a6ee","resolution":{"observed_at":"2026-08-06T17:49:48.873402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-06T17:49:48.876571Z","title":"arXiv preprint arXiv:2403.07974","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.876571Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:0df0bf7a2d85202e151df3c551dd6bbf4261cafa85ccd25e23322108d2d6d46c","observation_id":"d3fefc30-e5ef-4c7b-9015-431dd6635dc1","resolution":{"observed_at":"2026-08-06T17:49:48.876571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00223","last_updated":"2025-04-12T03:17:26Z","snapshot_observed_at":"2026-08-07T17:38:11.374070Z","submitted_at":"2025-02-28T22:16:42Z","title":"DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00223","snapshot_observed_at":"2026-08-06T17:49:48.879997Z","title":"arXiv preprint arXiv:2503.00223","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.879997Z"},"links":{"cited_paper":"/paper/2503.00223","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:8ad162a477cc65322d6af933cacb69acaeedc2442df7a43422dc32e6f18379cc","observation_id":"7070c892-62b0-4f54-98b4-5e5e37f5b15e","resolution":{"observed_at":"2026-08-06T17:49:48.879997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T17:49:48.883550Z","title":"arXiv preprint arXiv:2503.09516","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.883550Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:b7ccc969f422bfe3b5fd2056fc4073766325999d284cad607826c71983161e20","observation_id":"6d2cb0e4-9fe9-4341-83de-df80ba82a798","resolution":{"observed_at":"2026-08-06T17:49:48.883550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14652","last_updated":"2025-06-09T17:40:25Z","snapshot_observed_at":"2026-08-08T07:13:10.579807Z","submitted_at":"2025-05-20T17:41:33Z","title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14652","snapshot_observed_at":"2026-08-06T17:49:48.886824Z","title":"https://pretty-radio-b75.notion.site/DeepScaleR- Surpassing-O1-Preview-with-a-1-5B-Model-by-Scaling- RL-19681902c1468005bed8ca303013a4e2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.886824Z"},"links":{"cited_paper":"/paper/2505.14652","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:20c9f28eb7b8c3c739ee7a4c29b1a7378b421e5d810dcd3616700b612c39baf1","observation_id":"1a004ef3-4a04-48a4-845c-295a6671fe8a","resolution":{"observed_at":"2026-08-06T17:49:48.886824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T17:49:48.890668Z","title":"arXiv:2412.15115","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.890668Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:01be4b985066bfe12c2a05f76bb2784b24aba1e9e023bd947852e5a2b5a292c0","observation_id":"4e543e72-80ad-4388-8f02-6f92db97f864","resolution":{"observed_at":"2026-08-06T17:49:48.890668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T17:49:48.893888Z","title":"5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.893888Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:ec6794c13eb74b00f83ccdee30d2cecfded69ed302a94a3c09f747e1fea4df7c","observation_id":"8ae7cfdd-b392-4b90-b110-082d0e15fcd7","resolution":{"observed_at":"2026-08-06T17:49:48.893888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-06T17:49:48.897231Z","title":"arXiv preprint arXiv:2502.14768","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.897231Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:c1cf47ac13f1b9a358164e82ca46a8355d9e46080ff14652df1b133b8215ad88","observation_id":"81902f57-9559-4d39-afd6-72368a5a7d06","resolution":{"observed_at":"2026-08-06T17:49:48.897231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T17:49:48.900540Z","title":"arXiv preprint arXiv:2505.09388","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.900540Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:a763e6a64791b2bb839e14ed220d2453b581bd519118514e648dd00c9faa5ae4","observation_id":"0e99f4c8-32c0-408e-bc69-88fc228d11c8","resolution":{"observed_at":"2026-08-06T17:49:48.900540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-06T17:49:48.903818Z","title":"5-math tech- nical report: Toward mathematical expert model via self- improvement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.903818Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:d157d3358b5dcc4dcb790e73bb70785ccffd82de50cadc3a149728f126b5755c","observation_id":"332500ce-3a44-446d-aff7-d1c13f37d7ba","resolution":{"observed_at":"2026-08-06T17:49:48.903818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T17:49:48.907597Z","title":"arXiv preprint arXiv:2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.907597Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:64106f4c0e57e4ed48b460a3c4c66d09a6b881c1b819bf433c952521ed91377c","observation_id":"003fe291-36ba-42ae-a5e7-0d83837e0809","resolution":{"observed_at":"2026-08-06T17:49:48.907597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-06T17:49:48.910946Z","title":"Zeng, W.; Huang, Y .; Liu, Q.; Liu, W.; He, K.; Ma, Z.; and He, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.910946Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:ea9c9213d43bb9232e7f90e70dd2b3ed068153b6b19b1a0936b007e244f32536","observation_id":"d92a66cf-d87f-4abc-bbaa-d138f398c6b9","resolution":{"observed_at":"2026-08-06T17:49:48.910946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-06T17:49:48.914469Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.914469Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:78722006dd3bddd819a36f433913d18fa0c738eb79e35b16789530087a7f4c00","observation_id":"a38d3e39-0f8f-4e0d-be8c-39315a58f80d","resolution":{"observed_at":"2026-08-06T17:49:48.914469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T17:49:48.864782Z","title":"arXiv preprint arXiv:2103.03874","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.864782Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:d884a431ed689f7881801ab5816c803d2ba2afd0006759dcb920a3a9b0b58b2f","observation_id":"5c0414a1-b3fd-4dcd-8341-85140fe79917","resolution":{"observed_at":"2026-08-06T17:49:48.864782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:49:48.842369Z","title":"arXiv preprint arXiv:2303.08774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.842369Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:60e11b711d0fe4290b96238df36257a8a4c86bea297a2a904a93886e4544c826","observation_id":"991ac967-1ac3-419e-804a-bb427429f4b5","resolution":{"observed_at":"2026-08-06T17:49:48.842369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-06T17:49:48.847154Z","title":"arXiv:2403.17297","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.847154Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:f7ed5e8d6d645f561e0ae218504ae1fa67aca45b6eba1b7d00bb32d4746d6cf1","observation_id":"8c6a3e61-d768-423a-8971-08579dc3cdc2","resolution":{"observed_at":"2026-08-06T17:49:48.847154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19683","last_updated":"2025-05-26T08:44:53Z","snapshot_observed_at":"2026-08-08T09:25:43.689145Z","submitted_at":"2025-05-26T08:44:53Z","title":"Large Language Models for Planning: A Comprehensive and Systematic Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19683","snapshot_observed_at":"2026-08-06T17:49:48.851141Z","title":"Chen, D.; Yu, Q.; Wang, P.; Zhang, W.; Tang, B.; Xiong, F.; Li, X.; Yang, M.; and Li, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:48.851141Z"},"links":{"cited_paper":"/paper/2505.19683","citing_paper":"/paper/2507.09884"},"observation_digest":"sha256:edd4b1ec8635f1e25a4973c79d66aecd6153bc9d45ba0ec04bde16a4ee550f46","observation_id":"2d2c72f4-818e-462f-aa3d-cb4d81e25ec6","resolution":{"observed_at":"2026-08-06T17:49:48.851141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.09884","last_updated":"2025-07-26T11:17:08Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T07:13:35.945934Z","submitted_at":"2025-07-14T03:45:24Z","title":"VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 5 inbound Pith citation observations for arXiv:2507.09884."}