Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T17:49:48.914469Z
Paper Citation Record · LEDGER
As of 8 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 5 inbound Pith citation observations for arXiv:2507.09884.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-06T17:49:48.914469Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-06T15:14:17.376888Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-01T20:56:13.335126Z
20 of 20 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation bb442253-fcea-468d-81fe-3f37eab76454 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Guo, D.; Yang, D.; Zhang, H.; Song, J.; Zhang, R.; Xu, R.; Zhu, Q.; Ma, S.; Wang, P.; Bi, X.; et al
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fa6af1dc-9e46-4735-a120-40a330f4e73c · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ccd24738-1a77-4728-b482-f0c4c7ae23b0 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ec0af700-209c-4b75-95d1-4d7e4594a6ee · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains arXiv preprint arXiv:2505.22203
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d3fefc30-e5ef-4c7b-9015-431dd6635dc1 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
Reference 9
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7070c892-62b0-4f54-98b4-5e5e37f5b15e · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DeepRetrieval: Hacking Real Search Engines and Retrievers with Large Language Models via Reinforcement Learning
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6d2cb0e4-9fe9-4341-83de-df80ba82a798 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1a004ef3-4a04-48a4-845c-295a6671fe8a · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains General-Reasoner: Advancing LLM Reasoning Across All Domains
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4e543e72-80ad-4388-8f02-6f92db97f864 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen2.5 Technical Report
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8ae7cfdd-b392-4b90-b110-082d0e15fcd7 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Kimi k1.5: Scaling Reinforcement Learning with LLMs
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 81902f57-9559-4d39-afd6-72368a5a7d06 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0e99f4c8-32c0-408e-bc69-88fc228d11c8 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen3 Technical Report
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 332500ce-3a44-446d-aff7-d1c13f37d7ba · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 003fe291-36ba-42ae-a5e7-0d83837e0809 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains DAPO: An Open-Source LLM Reinforcement Learning System at Scale
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d92a66cf-d87f-4abc-bbaa-d138f398c6b9 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a38d3e39-0f8f-4e0d-be8c-39315a58f80d · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5c0414a1-b3fd-4dcd-8341-85140fe79917 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Measuring Mathematical Problem Solving With the MATH Dataset
Reference 2021
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 991ac967-1ac3-419e-804a-bb427429f4b5 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains GPT-4 Technical Report
Reference 2023
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8c6a3e61-d768-423a-8971-08579dc3cdc2 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains InternLM2 Technical Report
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2d2c72f4-818e-462f-aa3d-cb4d81e25ec6 · outbound
VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains Large Language Models for Planning: A Comprehensive and Systematic Survey
Reference 2025
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7ba920d1-40c7-412f-9313-65550a564233 · inbound
CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0f8dab58-f029-481f-9742-466f818d888a · inbound
Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
Reference 15
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 3e09ee99-d4ad-46ba-9b71-fb408140785a · inbound
Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents? VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation fd70d5cb-8af4-46aa-a475-520df2530179 · inbound
Trust Region On-Policy Distillation VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.
Observation 6946d62b-d7f5-4cf7-9ccc-2c5d8933f80b · inbound
AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification VerifyBench: A Systematic Benchmark for Evaluating Reasoning Verifiers Across Domains
Reference 23
Source-reported events for the cited work
Unavailable: canonical work link unavailable.