Pith. sign in

Paper Citation Record · LEDGER

LLM-as-a-Verifier: A General-Purpose Verification Framework

As of 10 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 5 inbound Pith citation observations for arXiv:2607.05391.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.05391 v2

Coverage vector

measured 95 of 95 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-11T07:02:51.850836Z

measured 100 of 100 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-10T04:59:12.973916Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-06T00:12:15.992700Z

Reference resolution

95 of 95 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved94
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation f55c91b1-5d47-4fd1-b038-e60d40f7924f · outbound

This paper cites Scaling Laws for Neural Language Models.

LLM-as-a-Verifier: A General-Purpose Verification Framework Scaling Laws for Neural Language Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:5e15189a81b1bf4792c3fd15681274179a78681ea28525d247ad6b7791416d3c

Observation 8ffa3366-e39a-4f28-a0f8-52935f8c285c · outbound

This paper cites Scaling Laws for Reward Model Overoptimization.

LLM-as-a-Verifier: A General-Purpose Verification Framework Scaling Laws for Reward Model Overoptimization

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:aa36da2387c57bd0e19c5862ca73c7cd8f02dee18ee1e24337addb7551062698

Observation 71e92306-613b-4935-a0ad-b753355627b2 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

LLM-as-a-Verifier: A General-Purpose Verification Framework Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:488853af92c2a688fc83483f95ea7816e6ffb16acfb0d918adb9d48c17a9a839

Observation b4c59a75-bbb2-4f71-a591-975a8e9f859c · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

LLM-as-a-Verifier: A General-Purpose Verification Framework Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:9543add71f9318023e7ba6acef31eb954dfa9f7ac0a7aa29bf19178f8ed75b18

Observation ab9f7920-47d7-416e-8226-cf0ff9ec9e1d · outbound

This paper cites URLhttps://arxiv.org/abs/2603.04304.

LLM-as-a-Verifier: A General-Purpose Verification Framework URLhttps://arxiv.org/abs/2603.04304

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:a5de0b126c172466a8a8e9191bfb998cab8812776e15c3bdad439c4b637e052c

Observation d1f15dad-7497-4caf-aebd-1852f3a138d3 · outbound

This paper cites Generative Verifiers: Reward Modeling as Next-Token Prediction.

LLM-as-a-Verifier: A General-Purpose Verification Framework Generative Verifiers: Reward Modeling as Next-Token Prediction

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:2f5defe2a0b6f4976e967ab0227cae888a4139c0799324ca192641260fcfd7e4

Observation 128752d3-1f9c-4f5f-b981-a92d58aa5802 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

LLM-as-a-Verifier: A General-Purpose Verification Framework Training Verifiers to Solve Math Word Problems

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:dd34af3004fc1eb1f3f26cdeb6ccfc6c90b6f4d4c2bcae5df53f85a20061a9aa

Observation f1bb6b44-408f-49d7-a544-9c8c132a57dd · outbound

This paper cites Let's Verify Step by Step.

LLM-as-a-Verifier: A General-Purpose Verification Framework Let's Verify Step by Step

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:28ff276a39289e6a4628ef3d40fe4b0d80905365361aa92f0dd066e5263b2f1e

Observation 44dc11b6-73c7-4735-befd-005e2d059244 · outbound

This paper cites Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons.

LLM-as-a-Verifier: A General-Purpose Verification Framework Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:2ad25b85aa26cd957a4ba212b9b43dd256e4bdfeaeeaadb80ab0c4ff920f5e61

Observation 3c6e1b83-dc0c-465b-8bd1-21eb50117013 · outbound

This paper cites Topreward: Token probabilities as hidden zero-shot rewards for robotics.arXiv preprint arXiv:2602.19313, 2026.

LLM-as-a-Verifier: A General-Purpose Verification Framework Topreward: Token probabilities as hidden zero-shot rewards for robotics.arXiv preprint arXiv:2602.19313, 2026

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:44e9f2480051a9d5f28f2f46d64956779af98dd8c6cbceb7a50cf50670ec40c1

Observation fb8a223f-ef8c-4707-8c94-8c170bad9bf6 · outbound

This paper cites RoboReward: General-purpose vision-language reward models for robotics, 2026.

LLM-as-a-Verifier: A General-Purpose Verification Framework RoboReward: General-purpose vision-language reward models for robotics, 2026

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:794cd17c2d3826b6f6e36896aca9dc1c1fff2b03cf6debbac878e07e0dde2065

Observation f5cb24fe-f1f6-496d-aeaa-a7c04d53b76d · outbound

This paper cites LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning.

LLM-as-a-Verifier: A General-Purpose Verification Framework LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:ab9db8dc2c2ffe99e830d4380f8afa9e5220388c07acccccf3d72d7084476720

Observation be5595fb-da5a-44bc-9937-ca43e97cf601 · outbound

This paper cites Steering Your Diffusion Policy with Latent Space Reinforcement Learning.

LLM-as-a-Verifier: A General-Purpose Verification Framework Steering Your Diffusion Policy with Latent Space Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:dbc220206c882f699e4d6cd49f205452c8d26598e421110294faa9ad41da37a6

Observation bcb07cd1-343b-40cb-9401-c4deeb814815 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

LLM-as-a-Verifier: A General-Purpose Verification Framework DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:bee8b926c7d0fbfd599b53594037750a1168bf6912647ecb62f06b040fe23046

Observation 30f318c2-7c22-4f72-ae31-9b83b5d52cee · outbound

This paper cites Learning to summarize from human feedback.

LLM-as-a-Verifier: A General-Purpose Verification Framework Learning to summarize from human feedback

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:86e7c89e36c8353b927966f1161086c24c7eb0f9bd347c7bc0f8f6bbba3b1550

Observation 4459bd1a-387e-4053-b86b-1f9915963925 · outbound

This paper cites Gemini 2.5 Flash.

LLM-as-a-Verifier: A General-Purpose Verification Framework Gemini 2.5 Flash

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:d3b342ea5e4bac07ec3d625497f5b10cc3877184f3603f5a65ddceea52bca090

Observation 7d282e79-310d-4e78-88b5-5a15e58ec1c4 · outbound

This paper cites Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces.

LLM-as-a-Verifier: A General-Purpose Verification Framework Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:b02d499f628a5a781ea123300204d6c0da5cb15478c73732b5f77e7297d62f4a

Observation 7b4d97d1-5cad-4b99-b130-49daa6ab34e6 · outbound

This paper cites Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan.

LLM-as-a-Verifier: A General-Purpose Verification Framework Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:ffdb177d7e4116fe3e2e9348f2c0a36fc9c9b23d2ca99b23ef299f6b757de8a2

Observation 7aa9590a-9cb4-4d3f-8a77-4db98162a74d · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

LLM-as-a-Verifier: A General-Purpose Verification Framework SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:d9bab3a320be1ea3dce2731cf3ddb1d0632eaeb5957b2bbafc17f87411f2822c

Observation c3be7f12-5a67-4816-b980-af59e74381f0 · outbound

This paper cites an unresolved cited work.

LLM-as-a-Verifier: A General-Purpose Verification Framework Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:ed59cd1893a9ea2371ce77677c69d4e32a43681e5e3172537e4d1f6016bebca2

Observation 3aca4ddd-0a53-442c-b0f2-feea30e63f2c · outbound

This paper cites URL https://www.tbench.ai/leaderboard/terminal-bench/2.0/capy-build/unknown/ gpt-5.5%40openai.

LLM-as-a-Verifier: A General-Purpose Verification Framework URL https://www.tbench.ai/leaderboard/terminal-bench/2.0/capy-build/unknown/ gpt-5.5%40openai

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:d2ce9c1109b3e3c7844ae8202a13de1c04fc7eaf76b834c665873d31aefb3feb

Observation e5e5f8e8-0a0b-43e0-a5ed-1629c0afb394 · outbound

This paper cites URL https://github.com/harbor-framework/terminal-bench/tree/main/ terminal_bench/agents/terminus_2.

LLM-as-a-Verifier: A General-Purpose Verification Framework URL https://github.com/harbor-framework/terminal-bench/tree/main/ terminal_bench/agents/terminus_2

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:67a4becf12917d05c2461ddb4e5c6492bb686880c638ffcbc0d31171b2904a6f

Observation 27534865-1d49-4b99-b166-9facc21c7358 · outbound

This paper cites Vision Language Models are In-Context Value Learners.

LLM-as-a-Verifier: A General-Purpose Verification Framework Vision Language Models are In-Context Value Learners

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:c90e2e380c017aeb6566e57f629297816f5c4ab44e2d0aa989086ae2adb3c520

Observation b819d4be-6c06-42a2-8123-63425233c897 · outbound

This paper cites $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control.

LLM-as-a-Verifier: A General-Purpose Verification Framework $\pi_0$: A Vision-Language-Action Flow Model for General Robot Control

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:303b7109e4b5bf98dd5b9c33ea5548e0adc9432cee7ab465a3d8412a9962124f

Observation bdcda714-7055-4a2e-a2a3-ecb6130f355c · outbound

This paper cites Qwen3 Technical Report.

LLM-as-a-Verifier: A General-Purpose Verification Framework Qwen3 Technical Report

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:a37c8593260c73cbfc481e43dbac599a80d9f7f012c33e5bb39cfcb70dc762c1

Observation b464b566-60bc-46e8-9b48-3048dbefe0f1 · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

LLM-as-a-Verifier: A General-Purpose Verification Framework Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:e5b60bcebcc41d849ba95358e4e3effc47b94e8194da202a1dc89111e7461849

Observation 93a2a312-e723-4b22-ac3a-a09547315ddd · outbound

This paper cites Large Language Models are Zero-Shot Reasoners.

LLM-as-a-Verifier: A General-Purpose Verification Framework Large Language Models are Zero-Shot Reasoners

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:1637c4dd9ba86eb48153bf559b85276da5a0619a46a5fd36f2fdded433ebfd96

Observation 1261d2b8-67f0-4493-baf7-e3dfde008ec1 · outbound

This paper cites Le, and Ed H.

LLM-as-a-Verifier: A General-Purpose Verification Framework Le, and Ed H

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:b701bb8f1cff04b6fadaa4ee59556939028ff347cf44b55a62d0065f14590cd3

Observation a63de5e2-2854-406f-bc2e-21e7271c45b4 · outbound

This paper cites Self-Consistency Improves Chain of Thought Reasoning in Language Models.

LLM-as-a-Verifier: A General-Purpose Verification Framework Self-Consistency Improves Chain of Thought Reasoning in Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:c1d69219d4ee8c8a1723a25697c9d7354557fc38d1d74b1150699c8ee4261758

Observation 6ebb32fa-cd53-42ee-988a-bd4621eb7695 · outbound

This paper cites Tree of thoughts: Deliberate problem solving with large language models.Advances in neural information processing systems, 36:11809–11822, 2023.

LLM-as-a-Verifier: A General-Purpose Verification Framework Tree of thoughts: Deliberate problem solving with large language models.Advances in neural information processing systems, 36:11809–11822, 2023

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:776f0ac5c543d46a97a7042bd5f8a93626702e55b9e7f0456262316cfbf14a53

Observation 5a6667e2-6171-4962-bdc5-b66d87e6ac1a · outbound

This paper cites Graph of Thoughts: Solving Elaborate Problems with Large Language Models.

LLM-as-a-Verifier: A General-Purpose Verification Framework Graph of Thoughts: Solving Elaborate Problems with Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:b226294c6749696b6e79fdfa55da698756743dea33538094fbfd9169ae03c35c

Observation 4851ab17-ff44-420c-ab3f-6cc4fd0aebca · outbound

This paper cites ReAct: Synergizing reasoning and acting in language models.

LLM-as-a-Verifier: A General-Purpose Verification Framework ReAct: Synergizing reasoning and acting in language models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:7a8d535c7ea174dec09eb6913ae3d3166725fc6ab5098f661ecfd0e6c861ee14

Observation 89204035-561d-4e1a-9817-6978bcb41109 · outbound

This paper cites Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models.

LLM-as-a-Verifier: A General-Purpose Verification Framework Language Agent Tree Search Unifies Reasoning Acting and Planning in Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:d34a42c0cd587bf1275320b8e9d19f9a9d1fcffb7229389bb035bff67074c4e2

Observation 5c6911e2-e729-4c75-aaf2-6cfcd0a7e6b2 · outbound

This paper cites Reasoning with language model is planning with world model.

LLM-as-a-Verifier: A General-Purpose Verification Framework Reasoning with language model is planning with world model

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:415e133a4d3d4d3171e4233c012109b68da3724e7497ebdb2013ba863817ae11

Observation 23224799-541a-4ece-ad26-a35ac5686095 · outbound

This paper cites Large Language Models are Better Reasoners with Self-Verification.

LLM-as-a-Verifier: A General-Purpose Verification Framework Large Language Models are Better Reasoners with Self-Verification

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:62fe8f74fadcb133a56f54210e6dcb19c15248b8ad5581897065e36269874e93

Observation 0c1aaa43-7926-405a-8b3c-4c7c23411194 · outbound

This paper cites Self-Refine: Iterative Refinement with Self-Feedback.

LLM-as-a-Verifier: A General-Purpose Verification Framework Self-Refine: Iterative Refinement with Self-Feedback

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:bc222d40b4a508f3e7daf2996f66a00bb20980cda256de499aa7c1d70d7b5166

Observation a511c53d-c90d-4b8d-ae4c-d0b5f6237d74 · outbound

This paper cites Reflexion: Language Agents with Verbal Reinforcement Learning.

LLM-as-a-Verifier: A General-Purpose Verification Framework Reflexion: Language Agents with Verbal Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:47a4dff99b99f25907ce6ea9e65b1b8cfe7318c64f9ab36674a20d1b27387b5e

Observation ae0aea5a-7598-46a9-97bc-e0e3860cc188 · outbound

This paper cites CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing.

LLM-as-a-Verifier: A General-Purpose Verification Framework CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing

Reference 38

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:97c26895ad4b1c981442478ae22756d3b5ecccf3760435df29bc1943418837aa

Observation 5b7d6cad-5440-45f6-a52e-74e4dc9203df · outbound

This paper cites GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning.

LLM-as-a-Verifier: A General-Purpose Verification Framework GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning

Reference 39

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:32262dd3f7fbdc3a535f9e61d60d365bc31a206ee60aaa00305b2bb2e8025153

Observation c8b1c71e-98e0-4146-8c88-91dd8dbc4d8b · outbound

This paper cites an unresolved cited work.

LLM-as-a-Verifier: A General-Purpose Verification Framework Unresolved cited work

Reference 40

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:1d661e4d3816a3381d988b27e21feb0a1e755ece41bae5f98809cbb58896c75b

Observation 5fed5ba3-8612-420e-9ab8-56de02cc4b38 · outbound

This paper cites AlphaEvolve: A coding agent for scientific and algorithmic discovery.

LLM-as-a-Verifier: A General-Purpose Verification Framework AlphaEvolve: A coding agent for scientific and algorithmic discovery

Reference 41

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:b977c169bfa309757367994af6ca1538bece14659cb29a35380b3467376a320f

Observation eac4cd1c-082f-4568-a1bf-2ecbec9cc440 · outbound

This paper cites Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals.

LLM-as-a-Verifier: A General-Purpose Verification Framework Mankowitz, Esme Sutherland Robson, Pushmeet Kohli, Nando de Freitas, Koray Kavukcuoglu, and Oriol Vinyals

Reference 42

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:55e790fda9336c700c9d3e6656161fa85e36a91d397769b7ea5b181cdd6cf650

Observation abcc0918-3fa5-4e1c-8e08-62b5f903d970 · outbound

This paper cites Le, Christopher Ré, and Azalia Mirhoseini.

LLM-as-a-Verifier: A General-Purpose Verification Framework Le, Christopher Ré, and Azalia Mirhoseini

Reference 43

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:00763ad3da3a374187c6ab4f4fef85eca87bb34846ef8ec82bb94d5c4456aa78

Observation 627b1007-72fa-4503-adde-915413945a20 · outbound

This paper cites Large Language Monkeys: Scaling Inference Compute with Repeated Sampling.

LLM-as-a-Verifier: A General-Purpose Verification Framework Large Language Monkeys: Scaling Inference Compute with Repeated Sampling

Reference 44

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:6d3b49f6b9dfda4acedc5927c34daa68543e8e1d77e56437947fd0696d211258

Observation 0e2fcb5d-9bcb-4493-b8a7-56cd062cea4d · outbound

This paper cites Inference-aware fine-tuning for best-of-N sampling in large language models, 2024.

LLM-as-a-Verifier: A General-Purpose Verification Framework Inference-aware fine-tuning for best-of-N sampling in large language models, 2024

Reference 45

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:4ff4b622e83496d938bdcacd10cdb03961e480eae3baa71715354ad51cec3411

Observation b552de93-f21d-4aa0-85ec-2410ae7c14a1 · outbound

This paper cites GPTScore: Evaluate as You Desire.

LLM-as-a-Verifier: A General-Purpose Verification Framework GPTScore: Evaluate as You Desire

Reference 46

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:80ec91684e718f19f1f48d71762b15cde35d949e34f13d1271070c437d9cbb4e

Observation 08f0cff5-7b56-4868-9730-75153130b0c3 · outbound

This paper cites G-eval: NLG evaluation using GPT-4 with better human alignment.

LLM-as-a-Verifier: A General-Purpose Verification Framework G-eval: NLG evaluation using GPT-4 with better human alignment

Reference 47

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:ad47d47b23ef02e501ea90b2041d4afdeb862088ccfe0f3f7a40f28af926555a

Observation 90437e6d-9db6-41f6-bc6e-72552aa43ca2 · outbound

This paper cites doi: 10.18653/v1/2023.emnlp-main.153.

LLM-as-a-Verifier: A General-Purpose Verification Framework doi: 10.18653/v1/2023.emnlp-main.153

Reference 48

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:ebcf178b6bd0e2f063e7c4e3104162d71287db7cec29b9ad8f79a576ad4ef9e5

Observation cb498ef1-45d2-4eba-939d-6b85ae9e122c · outbound

This paper cites Xing, Hao Zhang, Joseph E.

LLM-as-a-Verifier: A General-Purpose Verification Framework Xing, Hao Zhang, Joseph E

Reference 49

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:d27f777ac316ebd3e8b749d488c6ebdce628071713a4e3291100f5b7f7add56f

Observation 6da08d49-f0c8-4d45-9b3b-e5799ab1a02d · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

LLM-as-a-Verifier: A General-Purpose Verification Framework Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 50

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:1528687255a3e4e88bc0a0f6fd5224c0ef279433f2cdeb483a453d34bc4a2957

Observation 2114fef4-2e7f-4078-bc10-19361bce13f5 · outbound

This paper cites From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline.

LLM-as-a-Verifier: A General-Purpose Verification Framework From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

Reference 51

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:b6c511fa3c3b1593cdea10330daf11f1fd118a09e389c305b06d8cbe71254b64

Observation 85b10f22-d2c3-4088-9cb6-b95c00ee20b5 · outbound

This paper cites FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets.

LLM-as-a-Verifier: A General-Purpose Verification Framework FLASK: Fine-grained Language Model Evaluation based on Alignment Skill Sets

Reference 52

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:5e6609690713f169d60baf2416cec42aa08370a3e45f46476b6c7334997ac321

Observation bb47685b-c3ea-4688-a947-2625490feec5 · outbound

This paper cites Prometheus: Inducing fine-grained evaluation capability in language models.

LLM-as-a-Verifier: A General-Purpose Verification Framework Prometheus: Inducing fine-grained evaluation capability in language models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:04fe3cd7f9d38c25c6efa09ffa90b1280755ed1dce013e71ab1af2fd3153712b

Observation 65b118f9-6125-41c8-bc84-f3a60d53aa10 · outbound

This paper cites an unresolved cited work.

LLM-as-a-Verifier: A General-Purpose Verification Framework Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:0c66474c32e47fcf9f587fc93e9bd01062e655f35538689cb041e09105564aee

Observation 01659a7a-dfc2-40c8-a802-f63e4abeee92 · outbound

This paper cites Prometheus 2: An open source language model specialized in evaluating other language models, 2024.

LLM-as-a-Verifier: A General-Purpose Verification Framework Prometheus 2: An open source language model specialized in evaluating other language models, 2024

Reference 55

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:32edfa0ac52b4c967efb6d75c52c62a4cc070e4979ab30048dfba0b64014ef62

Observation a8142372-901f-49c6-b35e-f893e46b74cc · outbound

This paper cites Generative judge for evaluating alignment.

LLM-as-a-Verifier: A General-Purpose Verification Framework Generative judge for evaluating alignment

Reference 56

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:eaf19fda7b3a749dce8409bf0e3a2efcd51119d5827ce8a495959d6bc19ed33c

Observation 800f7d39-0df5-41c8-8f12-46c5e9f5be36 · outbound

This paper cites Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability.

LLM-as-a-Verifier: A General-Purpose Verification Framework Themis: A Reference-free NLG Evaluation Language Model with Flexibility and Interpretability

Reference 57

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:e68637bf84ce46e1bfa2d2d3b5fa786dd0015989cf3dd730e5ebcfab96d902d7

Observation 77cb4c56-63d1-42b1-bc9a-60a61b1a228d · outbound

This paper cites HD-eval: Aligning large language model evaluators through hierarchical criteria decomposition.

LLM-as-a-Verifier: A General-Purpose Verification Framework HD-eval: Aligning large language model evaluators through hierarchical criteria decomposition

Reference 58

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:82962ac249946535907198dc61b39c23dd09dd3b8383094fa357b132a257401a

Observation d4c50f9e-03c3-43fa-bebf-da7e2fa5774f · outbound

This paper cites PandaLM:An automaticevaluationbenchmarkforLLMinstructiontuningoptimization.

LLM-as-a-Verifier: A General-Purpose Verification Framework PandaLM:An automaticevaluationbenchmarkforLLMinstructiontuningoptimization

Reference 59

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:a47bc7315ba307741e084c09d3e61861824acce6202a5dd4912d80383b1ea581

Observation a299f0a0-01d0-4b89-bc8a-1a76daf7d99e · outbound

This paper cites JudgeLM: Fine-tuned large language models are scalable judges.

LLM-as-a-Verifier: A General-Purpose Verification Framework JudgeLM: Fine-tuned large language models are scalable judges

Reference 60

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:9c64b67eae6b6b16a458d54ff2542fc23d6e332547ea87742c5007f48b6df743

Observation bf80e6ca-8834-4c90-9157-c6afb65304d1 · outbound

This paper cites ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate.

LLM-as-a-Verifier: A General-Purpose Verification Framework ChatEval: Towards Better LLM-based Evaluators through Multi-Agent Debate

Reference 61

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:faddbba869a305533b0be7f4317a7411c90f08d527aeed8e4e26f2919c384873

Observation a5f1939b-7dbc-4939-b18d-c5fc4bb213c7 · outbound

This paper cites Shrinking the generation-verification gap with weak verifiers.arXiv preprint arXiv:2506.18203, 2025.

LLM-as-a-Verifier: A General-Purpose Verification Framework Shrinking the generation-verification gap with weak verifiers.arXiv preprint arXiv:2506.18203, 2025

Reference 62

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:4065ea3c0a977861c0a38b4ee302b10527bba6e4bb2a0ea65f4316f170174d61

Observation 460285ab-49af-43f7-b100-9b5bc651eb03 · outbound

This paper cites Large language models are not fair evaluators.

LLM-as-a-Verifier: A General-Purpose Verification Framework Large language models are not fair evaluators

Reference 63

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:67407f0faef51043e676948109afdc8de4e4e634e901c9d1a11589ce8f3ad212

Observation 481c9dfb-0f74-4efd-961b-865f2bfc1593 · outbound

This paper cites Evaluating large language models at evaluating instruction following.

LLM-as-a-Verifier: A General-Purpose Verification Framework Evaluating large language models at evaluating instruction following

Reference 64

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:c09ca61c9970d6758e027825acffef1ede60efac1f829cd14bf7eea323c35698

Observation c9b73bbf-03de-4ba3-b178-d538abc065d4 · outbound

This paper cites Benchmarking Cognitive Biases in Large Language Models as Evaluators.

LLM-as-a-Verifier: A General-Purpose Verification Framework Benchmarking Cognitive Biases in Large Language Models as Evaluators

Reference 65

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:f97651de5cf7910eede6b5c2139000c0834f564a68c8a9bcdd3e87d9e3b9c216

Observation 9d903bc7-1671-45df-82a5-b0383e87779d · outbound

This paper cites LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores.

LLM-as-a-Verifier: A General-Purpose Verification Framework LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores

Reference 66

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:1bab4c316927d7f8a5c3cea8f4631bb5131f5be63c557859e27bd18f746e0f48

Observation c1c3fb45-03e1-47ed-b3fb-afb656ed1620 · outbound

This paper cites JudgeBench: A benchmark for evaluating LLM-based judges.

LLM-as-a-Verifier: A General-Purpose Verification Framework JudgeBench: A benchmark for evaluating LLM-based judges

Reference 67

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:8c2dc7f39325f52de33b4a00a2e458b2471b79fa3b795f32a1280a0a2876a2be

Observation bad1870f-e62a-4db5-8c05-5f4d3eaa0e89 · outbound

This paper cites An empirical study of LLM-as-a-judge for LLM evaluation: Fine-tuned judge model is not a general substitute for GPT-4.

LLM-as-a-Verifier: A General-Purpose Verification Framework An empirical study of LLM-as-a-judge for LLM evaluation: Fine-tuned judge model is not a general substitute for GPT-4

Reference 68

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:3500564f1bba4e287745707a4ee33dc15d5d32b449334536353f57668e2f028f

Observation b7a9f655-9f30-4eb0-99d8-c68ab6d5b659 · outbound

This paper cites CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks.

LLM-as-a-Verifier: A General-Purpose Verification Framework CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks

Reference 69

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:b4041becceff7fdc0ef94853c5805043a279ac4a6274af09936638753033c8ba

Observation 7fe4ef8e-7ef3-4cbb-90fe-4457cebebf50 · outbound

This paper cites MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark.

LLM-as-a-Verifier: A General-Purpose Verification Framework MLLM-as-a-Judge: Assessing Multimodal LLM-as-a-Judge with Vision-Language Benchmark

Reference 70

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:7a55c0ac795414dbd5fac44a5547ab28945116747b22e18b4a066adbee427f0f

Observation e071b0f0-db76-401f-adcb-695c60fd0a31 · outbound

This paper cites Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation.

LLM-as-a-Verifier: A General-Purpose Verification Framework Prometheus-Vision: Vision-Language Model as a Judge for Fine-Grained Evaluation

Reference 71

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:345736fcfee4806f94fe7a42aecbdc6c6d35c47b861a8cb2a06ac7a2cbb4f37c

Observation ad819da2-2bf2-4957-82d1-61e88aafbb35 · outbound

This paper cites LLaVA-Critic: Learning to Evaluate Multimodal Models.

LLM-as-a-Verifier: A General-Purpose Verification Framework LLaVA-Critic: Learning to Evaluate Multimodal Models

Reference 72

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:64e4098861bc60bde1c7303ec7bacb47463568f0247349c05150c84f49840391

Observation 8c93d45e-0469-49ea-ba6d-17f975c76af1 · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

LLM-as-a-Verifier: A General-Purpose Verification Framework Solving math word problems with process- and outcome-based feedback

Reference 73

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:13ae9f930af0469095d02ef0851bfcf02aaf7280a06522aaa47350b7823c8ff4

Observation 2a02f34b-4e62-4d4a-9c0c-f39f55067a6f · outbound

This paper cites VIP: Towards universal visual reward and representation via value-implicit pre-training,.

LLM-as-a-Verifier: A General-Purpose Verification Framework VIP: Towards universal visual reward and representation via value-implicit pre-training,

Reference 74

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:6d89264bf8137c41fee19bb5df816c677200a7a98ded405461eff2585e4e25fc

Observation 1310acd4-f87e-4717-a0dd-aec57ce9dfdb · outbound

This paper cites VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training.

LLM-as-a-Verifier: A General-Purpose Verification Framework VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training

Reference 75

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:5226aa21b0ddfe0e459b631d4f23274f7bc1aa2d956cc396845c752683da977f

Observation a68434fb-7d6f-49c6-b07d-c8c18e3f2a6a · outbound

This paper cites LIV: Language-Image Representations and Rewards for Robotic Control.

LLM-as-a-Verifier: A General-Purpose Verification Framework LIV: Language-Image Representations and Rewards for Robotic Control

Reference 76

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:de7cec17e0b716d3bd800614c31c07f295e3f1dd6a5191720e98b371d042cc72

Observation 81243133-fb41-45de-8cc8-fca2b085034b · outbound

This paper cites Sontakke, Jesse Zhang, Sébastien M.

LLM-as-a-Verifier: A General-Purpose Verification Framework Sontakke, Jesse Zhang, Sébastien M

Reference 77

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:e62c927c78c0ba7e22a22d4cd0c95f079281a6f6282ab3103ee76f3193d19a05

Observation afa61f81-4c7d-4877-8f5b-10580d8c0c8f · outbound

This paper cites RoboCLIP: One Demonstration is Enough to Learn Robot Policies.

LLM-as-a-Verifier: A General-Purpose Verification Framework RoboCLIP: One Demonstration is Enough to Learn Robot Policies

Reference 78

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:9a9096092a9576b9ecd191a310af44774abac3136c0355d751fa6ce3dba8fc35

Observation d27b0c92-b711-49ec-a398-c26a00ba82a1 · outbound

This paper cites Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning.

LLM-as-a-Verifier: A General-Purpose Verification Framework Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Reference 79

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:dd2f99e3d5fc2e24bfff42299c7445fd796ca19ee272afae0d38df488ff372e6

Observation 2159aea4-c9d6-488c-bf68-f1ac3e07fd84 · outbound

This paper cites RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback.

LLM-as-a-Verifier: A General-Purpose Verification Framework RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 80

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:bcf84b7110e932a3dbe4685c8a896989bdf1c91ade55a3fd6cc9afb2197b4508

Observation 0e5994b9-f181-4ccf-8356-9aeb00c7c3af · outbound

This paper cites Language to Rewards for Robotic Skill Synthesis.

LLM-as-a-Verifier: A General-Purpose Verification Framework Language to Rewards for Robotic Skill Synthesis

Reference 81

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:188a524aa97632f0f8bda56d345218bad90890d5647b691d434c2516648ce696

Observation 452ca998-7168-4afb-8c1e-428707d1d97f · outbound

This paper cites Text2Reward: Reward Shaping with Language Models for Reinforcement Learning.

LLM-as-a-Verifier: A General-Purpose Verification Framework Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 82

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:3c416a0d9cf8be358b8eb4960423911a61f1fb84ab92a2fe60afa1120a3f59a4

Observation 0172d717-a7b0-4903-b8a0-27daae6f082d · outbound

This paper cites Eureka: Human-Level Reward Design via Coding Large Language Models.

LLM-as-a-Verifier: A General-Purpose Verification Framework Eureka: Human-Level Reward Design via Coding Large Language Models

Reference 83

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:71f0ae065dceb8e8ae1600956f399dbe3c5d97ba34db48bcb742b598849670fc

Observation 8f8f2769-e3e1-425b-b199-90a7a0b636e9 · outbound

This paper cites Lim, Jesse Thomason, Erdem Biyik, and Jesse Zhang.

LLM-as-a-Verifier: A General-Purpose Verification Framework Lim, Jesse Thomason, Erdem Biyik, and Jesse Zhang

Reference 84

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:f41910e3b57af99999ea8c956c3d6c7f0ebcc98288d0b40b35047a8e48ba75e8

Observation 7362ffb4-624c-4e66-8651-8578f6e79d9c · outbound

This paper cites SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation.

LLM-as-a-Verifier: A General-Purpose Verification Framework SARM: Stage-Aware Reward Modeling for Long Horizon Robot Manipulation

Reference 85

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:633a829367166b84e3b6c4e937f31c6650e482ea03aaec1a7c8053e0ac8e27bd

Observation d644c3bd-b56f-4e03-93a7-2505c60d8a8c · outbound

This paper cites Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance.

LLM-as-a-Verifier: A General-Purpose Verification Framework Steering Your Generalists: Improving Robotic Foundation Models via Value Guidance

Reference 86

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:ce32ed6a608f52e15af38b43c1ffa5cb80ec0ae71fe4a7acadacc60ea7a6c139

Observation e3eb01b9-be0d-4184-b697-e308253d8c17 · outbound

This paper cites Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling.

LLM-as-a-Verifier: A General-Purpose Verification Framework Bidirectional Decoding: Improving Action Chunking via Guided Test-Time Sampling

Reference 87

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:d5ce7bbcc0985f06d474963e1161d880ba0f6fd96ac2e54848fbaeb5aa814cd0

Observation f30661cf-cd98-40ae-8a34-d91f52a39059 · outbound

This paper cites RoboMonkey: Scaling test-time sampling and verification for vision-language- action models.

LLM-as-a-Verifier: A General-Purpose Verification Framework RoboMonkey: Scaling test-time sampling and verification for vision-language- action models

Reference 88

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:8e64432db9c5e646563864a745c27c65112c8602e53b9c4c06230b4dc7f00442

Observation b32664f1-d036-4651-88f2-b39bacacde24 · outbound

This paper cites Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress.

LLM-as-a-Verifier: A General-Purpose Verification Framework Unpacking Failure Modes of Generative Policies: Runtime Monitoring of Consistency and Progress

Reference 89

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:7a6f3fe26261f96816bc5cc432696ab0d0a87e382b85302a30f7ec1acc004dc5

Observation 29bdb0e4-9944-4d43-994c-52f6a0ad8a66 · outbound

This paper cites Scaling verification can be more effective than scaling policy learning for vision-language- action alignment, 2026.

LLM-as-a-Verifier: A General-Purpose Verification Framework Scaling verification can be more effective than scaling policy learning for vision-language- action alignment, 2026

Reference 90

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:dcf25080238cbef2d382901317b57739aeb70d8a1c0811d041c211bd251a13f2

Observation 2fdc84d5-7da1-49ee-bff1-d66f2c67b25a · outbound

This paper cites FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation.

LLM-as-a-Verifier: A General-Purpose Verification Framework FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation

Reference 91

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:bcb1721ceb41d579bc7390cc19b1536077d45f43f49e0841dc23fe40957118ad

Observation 726055b4-c0ff-4fc2-b31b-00150c257451 · outbound

This paper cites QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization.

LLM-as-a-Verifier: A General-Purpose Verification Framework QAFactEval: Improved QA-Based Factual Consistency Evaluation for Summarization

Reference 92

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:b6052497d4f9983e846574483f3f87d7a4dfff94b9c1f881aba9082ea57a0ade

Observation d09b7fde-c598-4851-98a9-1d61244a3156 · outbound

This paper cites SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models.

LLM-as-a-Verifier: A General-Purpose Verification Framework SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models

Reference 93

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:293755e0a7f10fea89842b562d863413f1fb4d9ae8c7a7a650f12a112c52d369

Observation 737ecf2c-6276-4a63-a36c-64a89a504146 · outbound

This paper cites World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry.

LLM-as-a-Verifier: A General-Purpose Verification Framework World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry

Reference 94

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:b3dce5bb90efb1e7715ce191e8085d76ce8e021226a8a6df28138b00abb5c191

Observation 295e4766-fdcb-47ea-9d6d-291d7fd652fc · outbound

This paper cites SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation.

LLM-as-a-Verifier: A General-Purpose Verification Framework SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

Reference 95

Resolution
malformed identifier
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:06e6e86415b2ee7c504b6debbff738137e1d047cf9ce576f0b2c2c70d3eff627

Pith citing papers

Observation d1f2b67b-4c8d-4134-a93a-2b055208e62b · inbound

Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration cites this paper.

Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration LLM-as-a-Verifier: A General-Purpose Verification Framework

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-01T17:46:56.897385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T17:46:56.897385Z digest=sha256:a3ab4bd6ed8effbf3af6a0b2ea229e5a66642bd54d3590e2ffa52b02d6236385

Observation 5635ad34-a720-4065-b69f-b132099a4386 · inbound

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning cites this paper.

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning LLM-as-a-Verifier: A General-Purpose Verification Framework

Reference 58

Resolution
unresolved
no resolver link, observed 2026-07-30T18:33:28.512215Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-30T18:33:28.512215Z digest=sha256:9514396e4678d3d6e53f567854253e16451bde988b192112be7395f893c7997f

Observation 324234cf-96c5-40a6-9c77-9101aa57a1d3 · inbound

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning cites this paper.

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning LLM-as-a-Verifier: A General-Purpose Verification Framework

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-03T01:47:25.009152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T01:47:25.009152Z digest=sha256:07c22a4c6979086b52677acb865b04dc1d974f66411a4c4fbd285a9b288c9b84

Observation a8dd1fcd-b443-4331-a919-1f7c28ec0438 · inbound

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review cites this paper.

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review LLM-as-a-Verifier: A General-Purpose Verification Framework

Reference 8

Resolution
metadata mismatch
local_arxiv, observed 2026-08-06T00:12:15.996343Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-06T00:12:15.578147Z digest=sha256:979201f51dfa47d73afb481a5c3b5620f0f21a2329d745a51d3ffa5823fc9002

Observation e511c256-8f9b-42bf-8f51-b1c08c10a7fd · inbound

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments cites this paper.

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments LLM-as-a-Verifier: A General-Purpose Verification Framework

Reference 195

Resolution
unresolved
no resolver link, observed 2026-08-10T04:59:12.973916Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-10T04:59:12.973916Z digest=sha256:e51e027033569ef5ee7701178601baf7a71af381c1e9931ed80c46c0af322c15