Pith. sign in

Paper Citation Record · LEDGER

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

As of 13 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 5 inbound Pith citation observations for arXiv:2507.09884.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.09884 v3

Coverage vector

measured 20 of 20 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T17:49:48.914469Z

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:14:17.376888Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T20:56:13.335126Z

Reference resolution

20 of 20 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bb442253-fcea-468d-81fe-3f37eab76454 · outbound

This paper cites Guo, D.; Yang, D.; Zhang, H.; Song, J.; Zhang, R.; Xu, R.; Zhu, Q.; Ma, S.; Wang, P.; Bi, X.; et al.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Guo, D.; Yang, D.; Zhang, H.; Song, J.; Zhang, R.; Xu, R.; Zhu, Q.; Ma, S.; Wang, P.; Bi, X.; et al

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.855844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.855844Z digest=sha256:b84591cbe2f68a664825cdb03bafc36e6f176a840b85f7c8f44dbbfc20a501b9

Observation fa6af1dc-9e46-4735-a120-40a330f4e73c · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.860372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.860372Z digest=sha256:170633012e65a99d1ef6a4c10d1b85ce2d305cbb71d25234205fbfd433926719

Observation ccd24738-1a77-4728-b482-f0c4c7ae23b0 · outbound

This paper cites Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.868873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.868873Z digest=sha256:69dc5836ff121739f31f34af68215cdde99aba9936dba502647e3f1f8d6aca17

Observation ec0af700-209c-4b75-95d1-4d7e4594a6ee · outbound

This paper cites arXiv preprint arXiv:2505.22203.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains arXiv preprint arXiv:2505.22203

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.873402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.873402Z digest=sha256:bb106551aed1ff551b5b2c808d302b13bd6087e9094ff408ac20f216f7c92204

Observation d3fefc30-e5ef-4c7b-9015-431dd6635dc1 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.876571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.876571Z digest=sha256:705f21b2a5c573cb7cb8b1ed9aa93683de4468168aa7138ab299d57da0a6f4ea

Observation 7070c892-62b0-4f54-98b4-5e5e37f5b15e · outbound

This paper cites DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.879997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.879997Z digest=sha256:860d92a69dedee847878993104f8b69a2fb63250dae83388354e25d0e2c81ff3

Observation 6d2cb0e4-9fe9-4341-83de-df80ba82a798 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.883550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.883550Z digest=sha256:29d49cf729eb727745f62fa62ecb205cc054a762cb98ea883b684fb67e35e1af

Observation 1a004ef3-4a04-48a4-845c-295a6671fe8a · outbound

This paper cites General-Reasoner: Advancing LLM Reasoning Across All Domains.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains General-Reasoner: Advancing LLM Reasoning Across All Domains

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.886824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.886824Z digest=sha256:5982150f5e82e355585787a6c19e02173a6b5d2879eee1ddc358bed77b417549

Observation 4e543e72-80ad-4388-8f02-6f92db97f864 · outbound

This paper cites Qwen2.5 Technical Report.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen2.5 Technical Report

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.890668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.890668Z digest=sha256:c7acefa45fe0265768ca006e53bef9b904167f050b3fe521ef9876ce3c97bd0e

Observation 8ae7cfdd-b392-4b90-b110-082d0e15fcd7 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.893888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.893888Z digest=sha256:04d899c1180614e7dd69ed22e93fe7ee98f210b7a74588a653888d10daabbe86

Observation 81902f57-9559-4d39-afd6-72368a5a7d06 · outbound

This paper cites Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.897231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.897231Z digest=sha256:825118952c79c27cadb12bdf3db7de9d908ea29b4d08a0d05e685350a4a35bfc

Observation 0e99f4c8-32c0-408e-bc69-88fc228d11c8 · outbound

This paper cites Qwen3 Technical Report.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen3 Technical Report

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.900540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.900540Z digest=sha256:58f890c6f9aa21bc72df15a854f49e5b975ad869cfe25b9bcb8d4abe40f256ff

Observation 332500ce-3a44-446d-aff7-d1c13f37d7ba · outbound

This paper cites Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.903818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.903818Z digest=sha256:ec81654912db7ad9f63f219efcfe714ebe64c8aae59fe1cc7414384035c93659

Observation 003fe291-36ba-42ae-a5e7-0d83837e0809 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.907597Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.907597Z digest=sha256:9cce1417f0fd197a3f3790eba03c6919946a57a9275cff5f85840ba02d334e8b

Observation d92a66cf-d87f-4abc-bbaa-d138f398c6b9 · outbound

This paper cites Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.910946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.910946Z digest=sha256:b9af3b1c4250151812bbcdce408dd4c9a10b931cfceec41c008fbd57c1c858d8

Observation a38d3e39-0f8f-4e0d-be8c-39315a58f80d · outbound

This paper cites SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.914469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.914469Z digest=sha256:eceeefab365d21a276bdbe8cd915b2b9dab5c9d73691a830c98387a5ddf0fc87

Observation 5c0414a1-b3fd-4dcd-8341-85140fe79917 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.864782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.864782Z digest=sha256:5f2b7b24310e077dd4e48dda01730f7365b1064e782da24e67c701a1c6e126dc

Observation 991ac967-1ac3-419e-804a-bb427429f4b5 · outbound

This paper cites GPT-4 Technical Report.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains GPT-4 Technical Report

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.842369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.842369Z digest=sha256:f99f8c063926cb564410110d22c73d9e2df2f1439a1481dc1139347675b98a7a

Observation 8c6a3e61-d768-423a-8971-08579dc3cdc2 · outbound

This paper cites InternLM2 Technical Report.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains InternLM2 Technical Report

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.847154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.847154Z digest=sha256:01d82fac2a7a2f190c51106140aa4eb6bd44fd2e2d523fdabcfd76e896190c19

Observation 2d2c72f4-818e-462f-aa3d-cb4d81e25ec6 · outbound

This paper cites Large Language Models for Planning: A Comprehensive and Systematic Survey.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Large Language Models for Planning: A Comprehensive and Systematic Survey

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.851141Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.851141Z digest=sha256:7c7112c2d49a01d5117eced58e67cf19ed928b9b1db1b45f89b82cb0ce5e5fa1

Pith citing papers

Observation 7ba920d1-40c7-412f-9313-65550a564233 · inbound

CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos cites this paper.

CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T15:14:17.376888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:14:17.376888Z digest=sha256:2d9e47861c77fe15682e667926fc8c6309ac4aadb3c1bd9282e48ab83fbe294d

Observation 0f8dab58-f029-481f-9742-466f818d888a · inbound

Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers cites this paper.

Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-25T07:40:28.733858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-25T07:39:02.616294Z digest=sha256:6844de4de5df35360f5c5ad6ee97087fb13ff939dd4408b5174b145d5d158656

Observation 3e09ee99-d4ad-46ba-9b71-fb408140785a · inbound

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? cites this paper.

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:18:11.800374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-20T10:15:37.280308Z digest=sha256:60f33e046dd88ac0c722eae0b7e665a2eb5ab2038cd4ac7ceb32cc5f08a70dc4

Observation fd70d5cb-8af4-46aa-a475-520df2530179 · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 33

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:56:13.336641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:a82c3bd54145175350b72cf4d7119ca7c7eadbbaade7209b0ba679366583b848

Observation 6946d62b-d7f5-4cf7-9ccc-2c5d8933f80b · inbound

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification cites this paper.

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-14T02:43:21.225324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T02:43:21.225324Z digest=sha256:2beb7615e4663bae881730e5b78e87c5dcb2f365081708efda22388b686fd04c