Pith. sign in

Paper Citation Record · LEDGER

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

As of 8 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 5 inbound Pith citation observations for arXiv:2507.09884.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.09884 v3

Coverage vector

measured 20 of 20 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T17:49:48.914469Z

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T15:14:17.376888Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T20:56:13.335126Z

Reference resolution

20 of 20 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation bb442253-fcea-468d-81fe-3f37eab76454 · outbound

This paper cites Guo, D.; Yang, D.; Zhang, H.; Song, J.; Zhang, R.; Xu, R.; Zhu, Q.; Ma, S.; Wang, P.; Bi, X.; et al.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Guo, D.; Yang, D.; Zhang, H.; Song, J.; Zhang, R.; Xu, R.; Zhu, Q.; Ma, S.; Wang, P.; Bi, X.; et al

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.855844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.855844Z digest=sha256:cbc23055d1a200c760a7979b4ef2e2e3c847fdbd8cc9545ab8037721f1cc6d15

Observation fa6af1dc-9e46-4735-a120-40a330f4e73c · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.860372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.860372Z digest=sha256:ade6dbc0d10be8f6d2aa993193b797f3703308008dafb2de2df7ebd8a78b75ed

Observation ccd24738-1a77-4728-b482-f0c4c7ae23b0 · outbound

This paper cites Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.868873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.868873Z digest=sha256:fd957c959f4514e1beed419f3ac64f9b96c598159f66541e239a268f800dd152

Observation ec0af700-209c-4b75-95d1-4d7e4594a6ee · outbound

This paper cites arXiv preprint arXiv:2505.22203.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains arXiv preprint arXiv:2505.22203

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.873402Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.873402Z digest=sha256:2b5ec38337fdbd0cd0da895ae540f05be76e5acf05f70e0d611539df5f8051a5

Observation d3fefc30-e5ef-4c7b-9015-431dd6635dc1 · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.876571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.876571Z digest=sha256:fc7bfce853ce51d775717632a32bdb772825093745b697b4c36dd54853c1762d

Observation 7070c892-62b0-4f54-98b4-5e5e37f5b15e · outbound

This paper cites DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.879997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.879997Z digest=sha256:d1c6c8cd04c7720174181bf3e76a217fff28fca2836416a6ada4666ddb9a1af3

Observation 6d2cb0e4-9fe9-4341-83de-df80ba82a798 · outbound

This paper cites Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.883550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.883550Z digest=sha256:609a5a44f14597b6593b36f99dbbd34c013c7d114bfa97f96802fbf171baef6c

Observation 1a004ef3-4a04-48a4-845c-295a6671fe8a · outbound

This paper cites General-Reasoner: Advancing LLM Reasoning Across All Domains.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains General-Reasoner: Advancing LLM Reasoning Across All Domains

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.886824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.886824Z digest=sha256:8ed8ef6687e931511f809a781a8a5d90205c2c459f8ec55def497b96f0783d80

Observation 4e543e72-80ad-4388-8f02-6f92db97f864 · outbound

This paper cites Qwen2.5 Technical Report.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen2.5 Technical Report

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.890668Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.890668Z digest=sha256:2efc728349e4651be9a67fd873b89f7cb60149dd2bd5b53c1426b94a76a6dfce

Observation 8ae7cfdd-b392-4b90-b110-082d0e15fcd7 · outbound

This paper cites Kimi k1.5: Scaling Reinforcement Learning with LLMs.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Kimi k1.5: Scaling Reinforcement Learning with LLMs

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.893888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.893888Z digest=sha256:49f2f0b5e3a1a323af2666ad01d75097156e42da56435f8eb2136979d605651b

Observation 81902f57-9559-4d39-afd6-72368a5a7d06 · outbound

This paper cites Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.897231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.897231Z digest=sha256:05854988311259fb42370243922390232a0c72b8cad32b29a6077adfd52eacb1

Observation 0e99f4c8-32c0-408e-bc69-88fc228d11c8 · outbound

This paper cites Qwen3 Technical Report.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen3 Technical Report

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.900540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.900540Z digest=sha256:53d812a9f85db122218e8ccc79fc61c0b7d284b76f25db6f350de08802297f61

Observation 332500ce-3a44-446d-aff7-d1c13f37d7ba · outbound

This paper cites Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.903818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.903818Z digest=sha256:f7b86affdf4ac3c37bd40c38cc16eac6c2f9d59eb98e7894d767b437a6c18da9

Observation 003fe291-36ba-42ae-a5e7-0d83837e0809 · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.907597Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.907597Z digest=sha256:c9101a7cab251e0b4bbf3a167002caa129e3ee9d4d6fd024f2512edbb9eef2d8

Observation d92a66cf-d87f-4abc-bbaa-d138f398c6b9 · outbound

This paper cites Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.910946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.910946Z digest=sha256:6626148669ea2e3b5ba00e75fc571b218be1efbf599ad1a59a9a15a18dfc565c

Observation a38d3e39-0f8f-4e0d-be8c-39315a58f80d · outbound

This paper cites SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.914469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.914469Z digest=sha256:6fd0028ac6f3952533ee17bf5294121946237cf598c8aedfff947b2e73011c3a

Observation 5c0414a1-b3fd-4dcd-8341-85140fe79917 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Measuring Mathematical Problem Solving With the MATH Dataset

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.864782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.864782Z digest=sha256:da828b75adaf7cb4af7e6b175abaec4e7318bebbb7d73bc5ff6c3cc66f46f912

Observation 991ac967-1ac3-419e-804a-bb427429f4b5 · outbound

This paper cites GPT-4 Technical Report.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains GPT-4 Technical Report

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.842369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.842369Z digest=sha256:0cb58f617fc0c399c53dbc560ad19ba76e6aefeb28b44d0f3ce90a0b06ae8b3d

Observation 8c6a3e61-d768-423a-8971-08579dc3cdc2 · outbound

This paper cites InternLM2 Technical Report.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains InternLM2 Technical Report

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.847154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.847154Z digest=sha256:1fa463d1d119bba3b7fdf5babdb913221f477196618ccca7bd249c73f42b23f8

Observation 2d2c72f4-818e-462f-aa3d-cb4d81e25ec6 · outbound

This paper cites Large Language Models for Planning: A Comprehensive and Systematic Survey.

VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Large Language Models for Planning: A Comprehensive and Systematic Survey

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-06T17:49:48.851141Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:49:48.851141Z digest=sha256:8abf5082a86dbef12d431a864164f30571e78014b89dc6f2dcc44a08777e0037

Pith citing papers

Observation 7ba920d1-40c7-412f-9313-65550a564233 · inbound

CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos cites this paper.

CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T15:14:17.376888Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T15:14:17.376888Z digest=sha256:9d1f91d01737fba7e93ede58134d90adaf3b9dba4fab2872ed1056f62cfabb08

Observation 0f8dab58-f029-481f-9742-466f818d888a · inbound

Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers cites this paper.

Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-25T07:40:28.733858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-25T07:39:02.616294Z digest=sha256:bfc66ff91543765a19314c7c44827a76f0e6550c084e37b6a693e1712d1a3d12

Observation 3e09ee99-d4ad-46ba-9b71-fb408140785a · inbound

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? cites this paper.

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-20T10:18:11.800374Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-20T10:15:37.280308Z digest=sha256:9247d5c48b7f9e353fc33aa5f2d10642deee9c205fdb9835138d776fede44089

Observation fd70d5cb-8af4-46aa-a475-520df2530179 · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 33

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:56:13.336641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:32a2e12ee5b52f511195a71d5d7c14d2203c5b6b9d08ed937afeace9b4ed1fa2

Observation 6946d62b-d7f5-4cf7-9ccc-2c5d8933f80b · inbound

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification cites this paper.

AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-14T02:43:21.225324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T02:43:21.225324Z digest=sha256:bf8399f37da47e69c4b2dacc7b089f9c9397ae48566b15ddc6bf24911c67e2ad