Pith. sign in

Paper Citation Record · LEDGER

DeepCritic: Deliberate Critique with Large Language Models

As of 22 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 8 inbound Pith citation observations for arXiv:2505.00662.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.00662 v1

Coverage vector

measured 60 of 60 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T04:42:07.631907Z

measured 68 of 68 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 8 of 8 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:33:12.754141Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T08:59:42.593762Z

Reference resolution

60 of 60 outbound references displayed

  • verified exact0
  • verified fuzzy11
  • unresolved48
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e42d56a4-ed69-4971-9198-49baa36b08d5 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

DeepCritic: Deliberate Critique with Large Language Models Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.317706Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.317706Z digest=sha256:b7dc9530c830a640c6a658a9e8cc8ba4d269f07abb712f0e80c06fe32da8b96e

Observation 97709941-4e7e-403b-8b0e-d25b482973ae · outbound

This paper cites Measuring Progress on Scalable Oversight for Large Language Models.

DeepCritic: Deliberate Critique with Large Language Models Measuring Progress on Scalable Oversight for Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.324494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.324494Z digest=sha256:4b86f45e1321def0c311ee8de6d7dcfdda30110f88d2d4db87715d2809dd159b

Observation 974dbcc6-c96d-4fde-8125-1a26d0070a00 · outbound

This paper cites Weak-to-strong generalization: eliciting strong capabilities with weak supervision.

DeepCritic: Deliberate Critique with Large Language Models Weak-to-strong generalization: eliciting strong capabilities with weak supervision

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.745240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.330356Z digest=sha256:6c7e32600bc48b93dcaf8755fb2661cc959d0fd2830f9025c534c1b5750e7c5a

Observation 58091933-36c6-4c93-8183-71165a77637c · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

DeepCritic: Deliberate Critique with Large Language Models Training Verifiers to Solve Math Word Problems

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.335493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.335493Z digest=sha256:60fb2d5059f71dfe0bf68c581ffcbe3f0ea5d5b3f6379c6d936a0fa98fe2e90c

Observation 834a1e4a-85ab-415e-953f-d961c5e5d81d · outbound

This paper cites Process Reinforcement through Implicit Rewards.

DeepCritic: Deliberate Critique with Large Language Models Process Reinforcement through Implicit Rewards

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.340445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.340445Z digest=sha256:5181a6c49ec865f130f376cccd3a66e8a640a3e200688a7f56ced917afaac45c

Observation 94cf3d7d-e678-41fb-9ac3-b0e1ed4250ab · outbound

This paper cites Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 1 2025.

DeepCritic: Deliberate Critique with Large Language Models Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 1 2025

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.727785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.345722Z digest=sha256:3e7956c095052e04379da654066c482f7d354909f1154fa96ba15e20bce09e21

Observation f1964553-28bf-472a-b7f9-3e833c5e482a · outbound

This paper cites LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback.

DeepCritic: Deliberate Critique with Large Language Models LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.350521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.350521Z digest=sha256:b797c9df3da383a4be23043ae3021c80b27009e346a9d4edc039698a2cceab4b

Observation 4cb44d9c-21ac-4edb-8823-fc9806cb49c2 · outbound

This paper cites Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models.

DeepCritic: Deliberate Critique with Large Language Models Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.357477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.357477Z digest=sha256:bd72c02ef4887ca4f2965cc315b9b5f8f314202ac6dbd71e518186e482f357f0

Observation 7ada40ff-c93d-4c04-8283-0d75bf02d69e · outbound

This paper cites Did aristotle use a laptop? a question answering benchmark with implicit reasoning strategies.

DeepCritic: Deliberate Critique with Large Language Models Did aristotle use a laptop? a question answering benchmark with implicit reasoning strategies

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.363469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.363469Z digest=sha256:efc5c7d34ea151ba9c31f5e2faa7e49c1e7664e66d1d448b896a6713bd198ee3

Observation f4fd0dfa-5f83-4b1e-9743-9523b5310af5 · outbound

This paper cites A Survey on LLM-as-a-Judge.

DeepCritic: Deliberate Critique with Large Language Models A Survey on LLM-as-a-Judge

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.368099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.368099Z digest=sha256:15a2b9749b11d3a53d5d039cfbc27f6062f485eb24dd20eb94cc9e7e3ce08a9a

Observation 86df7ff2-6425-4b53-a235-f777e8d1aef3 · outbound

This paper cites Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.

DeepCritic: Deliberate Critique with Large Language Models Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.373472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.373472Z digest=sha256:39890b7595bd1acaf90c4a6c112b7dae889a6dc6d09066dfee1ba1e86b679772

Observation afa0f929-3068-408e-b4d8-5e08b9962d8a · outbound

This paper cites Measuring mathematical problem solving with the MATH dataset.

DeepCritic: Deliberate Critique with Large Language Models Measuring mathematical problem solving with the MATH dataset

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.378980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.378980Z digest=sha256:b63b2922c566f413f027d8c0eb4a9915ee4f4d6ed7bb14e4ede709f8a4acc227

Observation 2ed360aa-ba13-4d0d-867d-da9a2c1792e8 · outbound

This paper cites Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model.

DeepCritic: Deliberate Critique with Large Language Models Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.384330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.384330Z digest=sha256:d5d89fe3ce3ab708d0bd0b8bcbfb61c964a8847bbd8e8282e1eb7995c6703c41

Observation ed949d4b-fa91-4c34-b842-1edb570e7e07 · outbound

This paper cites Qwen2.5-Coder Technical Report.

DeepCritic: Deliberate Critique with Large Language Models Qwen2.5-Coder Technical Report

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.389372Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.389372Z digest=sha256:c3ab317c81f922f4a4ad3441e21a0d57538150e2155c202161e66555dbae938e

Observation eaa2dc00-54d4-4ff4-8b56-14596bd123ed · outbound

This paper cites GPT-4o System Card.

DeepCritic: Deliberate Critique with Large Language Models GPT-4o System Card

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.394077Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.394077Z digest=sha256:86c800d5246ce3cd5256b394c7475d5abf74fc4b0f848bd16e371047738eb5b3

Observation 396c3529-11e2-46cf-a865-73c2399f4c04 · outbound

This paper cites SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations , 2024.

DeepCritic: Deliberate Critique with Large Language Models SWE-bench: Can language models resolve real-world github issues? In The Twelfth International Conference on Learning Representations , 2024

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.398733Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.398733Z digest=sha256:9ae99f539a38ebc93e5011e9f70c36765b1b3c95e385b49ded556a0ac765c6ed

Observation fb363920-1f2e-4432-b755-767485c1fcc0 · outbound

This paper cites CritiqueLLM: Towards an informative critique generation model for evaluation of large language model generation.

DeepCritic: Deliberate Critique with Large Language Models CritiqueLLM: Towards an informative critique generation model for evaluation of large language model generation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.403127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.403127Z digest=sha256:548a04aa6944de96c5958361afcc9e181bc55345da2087b53f6583e0d1d7ab68

Observation 7c81debc-3edb-4cd7-b1ab-dfbd6175ec03 · outbound

This paper cites Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs.

DeepCritic: Deliberate Critique with Large Language Models Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.407517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.407517Z digest=sha256:4b31718cf9d7524e5ea4c409140062102ac3c3b6c3c757a43e8e9307de630f51

Observation 9e30f58a-6ea0-49e9-a8db-0ffef06400cb · outbound

This paper cites Criticeval: Evaluating large-scale language model as critic.

DeepCritic: Deliberate Critique with Large Language Models Criticeval: Evaluating large-scale language model as critic

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.653006Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.414533Z digest=sha256:95fd9885ef65fac9e4fa2468e668ea8c3b00e4f2818d819e232d17f7846f6e11

Observation 999f43f7-7c61-4f52-b32c-4b86dd9ae24c · outbound

This paper cites Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13, 2024.

DeepCritic: Deliberate Critique with Large Language Models Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13, 2024

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.419993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.419993Z digest=sha256:ee0d620ed6eba2c1e02d1026a2067a34ee96d565d3956d1532f9be2a94b36208

Observation 5da94829-b43a-4a47-82f0-61d7e8de933b · outbound

This paper cites Let’s verify step by step.

DeepCritic: Deliberate Critique with Large Language Models Let’s verify step by step

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.424948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.424948Z digest=sha256:3760ff15da8fcc3d7b25b0c7049722c315930b46160c4f21a81f7a825a307d3b

Observation ecdd6e85-1949-4ec4-a055-f6f4d0187513 · outbound

This paper cites Criticbench: Benchmarking llms for critique-correct reasoning.

DeepCritic: Deliberate Critique with Large Language Models Criticbench: Benchmarking llms for critique-correct reasoning

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.613842Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.429629Z digest=sha256:d1d2de68fa6c46d0b1a4cdafeca94dc56f029efbb0a8e342047fcc2305efdc23

Observation 0f19ef65-55ac-4db3-821e-0d069bf55d2d · outbound

This paper cites DeepSeek-V3 Technical Report.

DeepCritic: Deliberate Critique with Large Language Models DeepSeek-V3 Technical Report

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.434620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.434620Z digest=sha256:d72efaab53e18c58c7142741c0946b4cfbd186595de6d488d212ebb723abb069

Observation bdaaf89d-ae88-44ef-855b-7de8c552d2b9 · outbound

This paper cites Critique Ability of Large Language Models.

DeepCritic: Deliberate Critique with Large Language Models Critique Ability of Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.439664Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.439664Z digest=sha256:1dcc42d656a9d9f70b430d964963a4001845c9f04bfd694202e3f23b79fc30e4

Observation c81d4b88-4319-4aed-88e1-39143338ec4e · outbound

This paper cites Large language models surpass human experts in predicting neuroscience results.

DeepCritic: Deliberate Critique with Large Language Models Large language models surpass human experts in predicting neuroscience results

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.598780Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.444552Z digest=sha256:44fc01c116082792e788799e74246488e0427e60f1c40470bb12a37e90e0e1b1

Observation 20d355a4-f854-4e18-93d0-8d46c969a5a2 · outbound

This paper cites Self-refine: Iterative refinement with self-feedback.

DeepCritic: Deliberate Critique with Large Language Models Self-refine: Iterative refinement with self-feedback

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.449197Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.449197Z digest=sha256:ffd1cf560f9536f3ca679bf188fc7166c20ec3871b1494deee4483c109c56804

Observation 16947f13-c97c-49be-be09-eb5680b7a1da · outbound

This paper cites LLM Critics Help Catch LLM Bugs.

DeepCritic: Deliberate Critique with Large Language Models LLM Critics Help Catch LLM Bugs

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.455016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.455016Z digest=sha256:e39a69fa187eb718ca4ac6b5ebdc2e9560194e08a3b304968d8d32e91bee1063

Observation 7e4b7420-ac85-46f0-9add-751533ef5f31 · outbound

This paper cites Introducing llama 3.1: Our most capable models to date.

DeepCritic: Deliberate Critique with Large Language Models Introducing llama 3.1: Our most capable models to date

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.571744Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.460454Z digest=sha256:628ec3c6dd7d6b3c990617f5c068ba696d54c4a002712a8a25545509edd599fc

Observation 51b3585a-3780-4ce6-a985-b0df45b861ee · outbound

This paper cites Gpt-4 technical report.

DeepCritic: Deliberate Critique with Large Language Models Gpt-4 technical report

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.555738Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.467324Z digest=sha256:85a4b50de956357dd59f5766757e1129f4fd70ab7044a0d1a28269ce67968e6d

Observation 2263a578-60f4-4b7a-9483-504e085311bd · outbound

This paper cites Learning to reason with llms, 2024.

DeepCritic: Deliberate Critique with Large Language Models Learning to reason with llms, 2024

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.539101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.472929Z digest=sha256:124b30e761a2c06c169a2cfac55df2985c0ef6071aa18bb4eb04fee78c500a36

Observation 43493cf3-7a27-4d1a-b6c9-8aa9d60ebfa6 · outbound

This paper cites Training language models to follow instructions with human feedback.

DeepCritic: Deliberate Critique with Large Language Models Training language models to follow instructions with human feedback

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.477945Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.477945Z digest=sha256:e490e3f9e12c8c857ce0f516caf91b5a3b7f18ad6eebed0b22e1265f61e04fac

Observation e6a338c6-d337-4365-86f1-3d9fc6a08dfa · outbound

This paper cites an unresolved cited work.

DeepCritic: Deliberate Critique with Large Language Models Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:42:08.511696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.483087Z digest=sha256:5c1f9177a0d16fe9c81e1d6459b1accd85a74779ee58bc089595db1053fd1def

Observation 68b51c03-b63e-4cc7-8d6a-2a362ba22fc1 · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

DeepCritic: Deliberate Critique with Large Language Models GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.487682Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.487682Z digest=sha256:659d442c861a538abf2c46daa5548b79b72972efd5a2a2a8a0615b90d0632bfc

Observation 414be28f-41b5-4703-9fe1-20279d941be3 · outbound

This paper cites Code Llama: Open Foundation Models for Code.

DeepCritic: Deliberate Critique with Large Language Models Code Llama: Open Foundation Models for Code

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.492622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.492622Z digest=sha256:0a694f3bbabd286525468ffc556af58af0f5d4333102c90ff0aa381e07da5e54

Observation 862ad342-2e92-4109-a88c-87d879528ab0 · outbound

This paper cites Self-critiquing models for assisting human evaluators.

DeepCritic: Deliberate Critique with Large Language Models Self-critiquing models for assisting human evaluators

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.498292Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.498292Z digest=sha256:d7b7131301231ca21d93e40d104fcfdd98dd7e2b1fd0ba25c8202ba70f92f39c

Observation 7b4398c8-083e-449a-80fa-388a1e743476 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

DeepCritic: Deliberate Critique with Large Language Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.503803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.503803Z digest=sha256:f0f007a1a2ce96d2ec93d1fd5c85683fe53c7f32f379dde22744e6c0456a48bf

Observation 252de94a-084e-4b9e-a2c1-3bcbb4c1fb6c · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

DeepCritic: Deliberate Critique with Large Language Models HybridFlow: A Flexible and Efficient RLHF Framework

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.508780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.508780Z digest=sha256:4709b22fa12b99f28e7961d2a5d02972caade4be2b047e7ba9b5178faed38394

Observation e08fd443-e38d-4a79-8748-886103911a6e · outbound

This paper cites Self-Evolving Critique Abilities in Large Language Models.

DeepCritic: Deliberate Critique with Large Language Models Self-Evolving Critique Abilities in Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.514164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.514164Z digest=sha256:b5212cff66ce0b66bfd4253411110e2e876a0c4f8cdb4d84e4cc139d370ac2f3

Observation 4eeb2d92-23d1-471c-b2a0-9f6a5df4b901 · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

DeepCritic: Deliberate Critique with Large Language Models Solving math word problems with process- and outcome-based feedback

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.520370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.520370Z digest=sha256:fc5be46e5620df218dfa5f0a5a5b57aaef8afe34439f4d095ef437555c3a9458

Observation c04e9fba-3e72-44ac-8210-4af93296e8de · outbound

This paper cites Math-shepherd: Verify and reinforce llms step-by-step without human annotations.

DeepCritic: Deliberate Critique with Large Language Models Math-shepherd: Verify and reinforce llms step-by-step without human annotations

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.526357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.526357Z digest=sha256:d1dc30041296988e770dd82e2339f3822397a6d8964215cbe82f60c1b5aeaa1f

Observation e5e53525-f12a-4b5f-b6d7-a937858a5c34 · outbound

This paper cites Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou.

DeepCritic: Deliberate Critique with Large Language Models Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.531677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.531677Z digest=sha256:c45c5f0d8de9700a97f1d24d608f3a5a4f4f0d6308b22c6ea2249567a0ac6e4f

Observation 4e2ab938-56c2-4a43-937b-90c45b2b7bd2 · outbound

This paper cites Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge.

DeepCritic: Deliberate Critique with Large Language Models Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.537404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.537404Z digest=sha256:fec7bc2a653ef446060c31b7c0f8f6da7b7bf27712cbc43e5308dc8a25681279

Observation 8970a22a-d1f2-417a-9064-b1a31b231a7f · outbound

This paper cites Scaling inference computation: Compute-optimal inference for problem-solving with language models.

DeepCritic: Deliberate Critique with Large Language Models Scaling inference computation: Compute-optimal inference for problem-solving with language models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.543491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.543491Z digest=sha256:0b310449d1fad0d3f84cb341a662eeccd2345bc209a60a5ea938664b0f42c3c1

Observation f05c4ddc-291c-42be-9d43-0b10c6a9e8a7 · outbound

This paper cites Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision.

DeepCritic: Deliberate Critique with Large Language Models Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.548871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.548871Z digest=sha256:6258a6034b93f7f674c071563b59bad474a035743152435062a9299ad6da7ef8

Observation 5c3e3503-df2d-442f-b5ac-f3c754546b83 · outbound

This paper cites Teaching language models to critique via reinforcement learning.

DeepCritic: Deliberate Critique with Large Language Models Teaching language models to critique via reinforcement learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.554782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.554782Z digest=sha256:9d3cb5da5e54a52656efcad604c08b4a57cd073e580d949bfb0857c993a8bacb

Observation 44e5e0e3-c221-4b39-81ab-fc65524dd9dc · outbound

This paper cites An implementation of generative prm, 2024.

DeepCritic: Deliberate Critique with Large Language Models An implementation of generative prm, 2024

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.464111Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.559632Z digest=sha256:1fc7787c15d3fde9292faa38629b601a4f8a71f2b683c2a135d38b6544a205a6

Observation 96d41639-67de-44bb-ae50-0a44c4202d45 · outbound

This paper cites An implementation of generative prm.

DeepCritic: Deliberate Critique with Large Language Models An implementation of generative prm

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.564784Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.564784Z digest=sha256:cbea122a768e7f2054d6e98497a9a2b8484c39f345806513719101488afe4a46

Observation aa0bb897-b685-47ce-a3da-7324de9580db · outbound

This paper cites Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement.

DeepCritic: Deliberate Critique with Large Language Models Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.571613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.571613Z digest=sha256:79ddb756bdc08ab1fe760a654362897df45ef8389688bcd5db0a301ce30f03c0

Observation 04121c85-a2ec-4fce-afe8-8696e9dc1d72 · outbound

This paper cites Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization.

DeepCritic: Deliberate Critique with Large Language Models Super(ficial)-alignment: Strong Models May Deceive Weak Models in Weak-to-Strong Generalization

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.576514Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.576514Z digest=sha256:89f6b298b1a2c434f8b6f76b469c53b787a7865cc06fdc3110959951847d7778

Observation 651ff0c2-1952-4f53-9df8-672228e0031a · outbound

This paper cites Towards thinking-optimal scaling of test-time compute for llm reasoning.

DeepCritic: Deliberate Critique with Large Language Models Towards thinking-optimal scaling of test-time compute for llm reasoning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.581313Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.581313Z digest=sha256:fb05474be7316f58c0bf4530977f7c0209bba12552eb825d2d2b4925ece6bf4e

Observation 3aff4f65-2a08-4fac-81ce-af5f7bdf339a · outbound

This paper cites Metamath: Bootstrap your own mathematical questions for large language models.

DeepCritic: Deliberate Critique with Large Language Models Metamath: Bootstrap your own mathematical questions for large language models

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.432337Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.585986Z digest=sha256:02ccd311c5b41339d52e0db051b45f6e977cd17cbf6a291058bf165353c5fcce

Observation 47a06cc0-8abd-4003-a8b6-86a8ea8635c7 · outbound

This paper cites Self-Rewarding Language Models.

DeepCritic: Deliberate Critique with Large Language Models Self-Rewarding Language Models

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.590588Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.590588Z digest=sha256:ce925b08d0f284db2a655aebb051805da86ab2b52b36a5af530c3339678566bc

Observation e57c6abf-80d9-40b1-9b90-c4595c6e3bee · outbound

This paper cites MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation.

DeepCritic: Deliberate Critique with Large Language Models MR-GSM8K: A Meta-Reasoning Benchmark for Large Language Model Evaluation

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.595607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.595607Z digest=sha256:edb178a7fd92015936c522e2658c65ffadd5045bbbf3d6f4cb07273fa44356f2

Observation db65d28f-b8d7-4bdd-9896-2e52600b7259 · outbound

This paper cites ProcessBench: Identifying Process Errors in Mathematical Reasoning.

DeepCritic: Deliberate Critique with Large Language Models ProcessBench: Identifying Process Errors in Mathematical Reasoning

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.600475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.600475Z digest=sha256:46b7c4fa8ab891d6443878a9c5a4556e6d7c5cfc42fec9aad0fc0d8ac04a6911

Observation 57ff0c52-adc4-4134-a911-bedbda4c35c1 · outbound

This paper cites Judging llm-as-a-judge with mt-bench and chatbot arena.

DeepCritic: Deliberate Critique with Large Language Models Judging llm-as-a-judge with mt-bench and chatbot arena

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T04:42:08.415325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.605348Z digest=sha256:4e2b1332c52df532bebafcdeb9d5566297eb5e08afccc25b805c1702295569a2

Observation 67ebcffe-0f8f-462b-a129-f234fbadc9c7 · outbound

This paper cites Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic.

DeepCritic: Deliberate Critique with Large Language Models Critic-CoT: Boosting the reasoning abilities of large language model via Chain-of-thoughts Critic

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-16T04:42:07.611186Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T04:42:07.611186Z digest=sha256:e8fc108e88ee5d1d5c7b466ff97678c281394575442556254350c02be295b1fa

Observation 2bd3c7c6-1689-44fa-a671-286c4057c856 · outbound

This paper cites an unresolved cited work.

DeepCritic: Deliberate Critique with Large Language Models Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:42:08.397944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.617044Z digest=sha256:2dc4b25316391d7c5e24353f79f8929c615493157c732fac6de97ef68f5f0f29

Observation 78dafb33-6032-45bf-8069-b20d261107b8 · outbound

This paper cites an unresolved cited work.

DeepCritic: Deliberate Critique with Large Language Models Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:42:08.380893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.621954Z digest=sha256:755d37d2797b53ac6085ff4fd9705f6b69e57653f5898938a517e8bc93b7961d

Observation 9b9d03c9-3229-416b-a452-e3ab2c57deb0 · outbound

This paper cites an unresolved cited work.

DeepCritic: Deliberate Critique with Large Language Models Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-16T04:42:08.363218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.627321Z digest=sha256:0e337e2b97db9e513309d0f444862434b43bdaeffaa19e0d8b79cb29fc63ca48

Observation c5a96f44-7a9c-4d60-8628-311264c86cca · outbound

This paper cites erroneous.

DeepCritic: Deliberate Critique with Large Language Models erroneous

Reference 60

Resolution
malformed identifier
raw_fallback, observed 2026-08-16T04:42:08.347199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-16T04:42:07.631907Z digest=sha256:d3ea9f716df8e0faafa4215703e2f58c6cae9700a660a3d92d2b59613a0b1161

Pith citing papers

Observation 7ad22a85-1b4c-49bd-8103-98a1074fff65 · inbound

Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation cites this paper.

Incentivizing Multimodal Reasoning in Large Models for Direct Robot Manipulation DeepCritic: Deliberate Critique with Large Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T20:33:12.754141Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:33:12.754141Z digest=sha256:1d1d1850e2c898c3cdf7111a8cf6b37fb31e2f9f2226f5eb8d3cd4efaf48d28a

Observation a6d0a0dc-20a9-4b37-b7ad-11ab42174270 · inbound

STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs cites this paper.

STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs DeepCritic: Deliberate Critique with Large Language Models

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T15:15:42.269555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:15:42.269555Z digest=sha256:2b750d8f5ca1b04092ee36c4c439665bf3e67918ce60a5fb6bb3bce5e4e3054c

Observation 294f5c9b-2f2c-4f5c-84ac-77f27ec6074b · inbound

RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback cites this paper.

RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback DeepCritic: Deliberate Critique with Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T15:47:33.218455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T15:47:33.218455Z digest=sha256:8ec20effffa1d1ec117a35044cbb8d5960325dd96cf74c47096cd039028308d8

Observation 0adfb6db-1cd0-4732-b701-6c23138684ff · inbound

Learning from Language Feedback via Variational Policy Distillation cites this paper.

Learning from Language Feedback via Variational Policy Distillation DeepCritic: Deliberate Critique with Large Language Models

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-20T20:39:00.278336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-05-20T20:34:36.764090Z digest=sha256:234085fb49c8e8df270c292fc8e84005a716062dc72613abeed6ea99c687ee0f

Observation 77ea421a-ac94-4d5a-967e-d6d653576187 · inbound

Trust Region On-Policy Distillation cites this paper.

Trust Region On-Policy Distillation DeepCritic: Deliberate Critique with Large Language Models

Reference 166

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T20:56:13.195536Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=arxiv_source observed=2026-06-28T17:38:50.313305Z digest=sha256:c5cd853401aeba7ab18645366b6975147729841a58bba40046c0f147c2627a73

Observation e9dfcf63-bd6a-4d79-881c-fefce6088ff4 · inbound

On the Position Bias of On-Policy Distillation cites this paper.

On the Position Bias of On-Policy Distillation DeepCritic: Deliberate Critique with Large Language Models

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-07-04T08:59:42.595312Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-06-26T10:45:16.028763Z digest=sha256:5f59c785b06915be281100e0fd8eef8fccb238c580125a19dbf0ca4639523537

Observation b1822564-c25c-469d-a5c0-99b73532b58e · inbound

On the Position Bias of On-Policy Distillation cites this paper.

On the Position Bias of On-Policy Distillation DeepCritic: Deliberate Critique with Large Language Models

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:13:49.287630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-06-29T05:14:12.795412Z digest=sha256:d28272cfb480a36616fc18b902b398049b686ab924c5a6bc8249635230d183d1

Observation 4be92d90-751e-4fa9-88f4-907765b67579 · inbound

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning cites this paper.

Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning DeepCritic: Deliberate Critique with Large Language Models

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-06T04:30:44.844166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T04:30:44.844166Z digest=sha256:5ca8d83a9043634fd0a7aaede3e6a97a8acd7ed0dbf638438a2cbccc87d94407