Pith. sign in

Paper Citation Record · LEDGER

HelpSteer2: Open-source dataset for training top-performing reward models

As of 19 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2406.08673.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2406.08673 v1

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 35 of 35 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 35 of 35 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T12:33:19.063498Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

2
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation d655d4cf-9b93-415e-84c2-e0a144d85aaf · inbound

Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs cites this paper.

Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs HelpSteer2: Open-source dataset for training top-performing reward models

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-17T16:18:01.675521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-17T16:18:01.560780Z digest=sha256:502fd3e607387e02146775560aa0ae2df2e876855bd0ab7d963d4674f16858af

Observation d561d878-9edc-4688-9068-72a3c8c167bc · inbound

Neon: News Entity-Interaction Extraction for Enhanced Question Answering cites this paper.

Neon: News Entity-Interaction Extraction for Enhanced Question Answering HelpSteer2: Open-source dataset for training top-performing reward models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-12T17:33:35.420485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T17:33:35.420485Z digest=sha256:62b11b2672f1a46785db250c7ed50c54f383c7a5f9f643a120bbdaf5edbd8090

Observation 5e5792f0-9ebf-48ac-bfaf-dcd252318112 · inbound

Reward Modeling with Ordinal Feedback: Wisdom of the Crowd cites this paper.

Reward Modeling with Ordinal Feedback: Wisdom of the Crowd HelpSteer2: Open-source dataset for training top-performing reward models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-12T17:15:47.938224Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T17:15:47.938224Z digest=sha256:8ff4c80f3112e2fed4ba9df97e73b712c2ca6590aea6e02a009e4a425cae69a8

Observation ce12127a-aba2-41c0-aedc-27fc53cc946c · inbound

Interpreting Language Reward Models via Contrastive Explanations cites this paper.

Interpreting Language Reward Models via Contrastive Explanations HelpSteer2: Open-source dataset for training top-performing reward models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T13:06:27.910817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T13:06:27.910817Z digest=sha256:ab015254fd0d13257b3d809029c09074d587f72a1e4ec8c647ca34abce72d870

Observation 5277e0aa-39f4-4e3d-9cdb-0541f6c20deb · inbound

Self-Generated Critiques Boost Reward Modeling for Language Models cites this paper.

Self-Generated Critiques Boost Reward Modeling for Language Models HelpSteer2: Open-source dataset for training top-performing reward models

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-12T12:58:30.536214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T12:58:30.536214Z digest=sha256:dde3b820ab5a3ec0c320b9fabc883b3a44815f6f6280a8dcb0c9446b168fcab2

Observation d76de97a-a0c9-4a79-9842-f6b9fa669d10 · inbound

Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment cites this paper.

Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment HelpSteer2: Open-source dataset for training top-performing reward models

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-12T11:03:01.245578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T11:03:01.245578Z digest=sha256:e00bb065d9f5db176cad9f07d628af0b815694eb0814722019bad55c4b10e277

Observation 5fe5e228-41a1-4b00-8d29-50f13a4701e5 · inbound

Yi-Lightning Technical Report cites this paper.

Yi-Lightning Technical Report HelpSteer2: Open-source dataset for training top-performing reward models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-12T04:34:12.100832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T04:34:12.100832Z digest=sha256:6c60c78b97a999d87d617f0c0a936cd44171ef96e75c582c7986b539348a635f

Observation b8c57ab6-079c-48fc-8754-5faf0619f4f0 · inbound

Weighted-Reward Preference Optimization for Implicit Model Fusion cites this paper.

Weighted-Reward Preference Optimization for Implicit Model Fusion HelpSteer2: Open-source dataset for training top-performing reward models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-11T22:48:22.834763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T22:48:22.834763Z digest=sha256:a7994e3ecdb218b7fdab22bdf94a1caf2adee9f73f45e2a95905e21ce482be63

Observation 8c6e3985-09e4-4046-9f32-5f2eb48742c4 · inbound

ALMA: Alignment with Minimal Annotation cites this paper.

ALMA: Alignment with Minimal Annotation HelpSteer2: Open-source dataset for training top-performing reward models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-11T21:38:06.784896Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T21:38:06.784896Z digest=sha256:0c0c7c7dc21d49e4da96fc9b4a6e8e152308c790f99a1768ab13b5a007e84776

Observation 15725ff4-32ee-4da2-80d6-910a317613ff · inbound

Data-adaptive Safety Rules for Training Reward Models cites this paper.

Data-adaptive Safety Rules for Training Reward Models HelpSteer2: Open-source dataset for training top-performing reward models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.206994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.206994Z digest=sha256:9ba08e2d4989dd0e3731ea49dcf07db6b284bcbaeb541e0a1125359dd45e4d3d

Observation 19f7cfba-beb8-46ec-a317-a83a09299070 · inbound

R.I.P.: Better Models by Survival of the Fittest Prompts cites this paper.

R.I.P.: Better Models by Survival of the Fittest Prompts HelpSteer2: Open-source dataset for training top-performing reward models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T23:02:23.423998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T23:02:23.423998Z digest=sha256:b90a1607f8f578aa79753e5a69187e7e8c6a58b6ef12ea0c3f56f510bef767b6

Observation 6a029ccd-4f98-48ef-9ea0-a947deed1b80 · inbound

Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach cites this paper.

Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach HelpSteer2: Open-source dataset for training top-performing reward models

Reference 163

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T15:39:41.285505Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-12T15:39:40.845703Z digest=sha256:da73aa6103bd7f53673c504a14c28d64934d58624dad7019e64b093592e7ffc3

Observation 1109fac1-d0c1-485c-ba78-d9ec08f5d82d · inbound

Reinforcement Learning from Human Feedback cites this paper.

Reinforcement Learning from Human Feedback HelpSteer2: Open-source dataset for training top-performing reward models

Reference 108

Resolution
verified exact
arxiv_id, observed 2026-05-22T19:32:01.189460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-22T19:27:40.991325Z digest=sha256:5d789670723eb7f2db536db1398860204bb1f375157c4198af4ce1d3a7e85bc4

Observation b6668993-b9bf-45b2-a6e8-98e72e691130 · inbound

Reinforcement Learning from Human Feedback cites this paper.

Reinforcement Learning from Human Feedback HelpSteer2: Open-source dataset for training top-performing reward models

Reference 108

Resolution
unresolved
no resolver link, observed 2026-08-16T12:33:19.063498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T12:33:19.063498Z digest=sha256:545fc9c670a97ba09c36b9a4e7931dfd45166f8c387ad3c12b05e10098b7c017

Observation 68fd61bc-e436-4825-8baf-73b7ce9743dd · inbound

Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning cites this paper.

Skywork-VL Reward: An Effective Reward Model for Multimodal Understanding and Reasoning HelpSteer2: Open-source dataset for training top-performing reward models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T22:24:50.645175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:24:50.645175Z digest=sha256:412596b906500e32f20ee7fcc441dd640dd2b4f5e2ba6bdd862afc29df146af6

Observation caed08d2-caed-4eec-b14c-a38746b092d5 · inbound

WorldPM: Scaling Human Preference Modeling cites this paper.

WorldPM: Scaling Human Preference Modeling HelpSteer2: Open-source dataset for training top-performing reward models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.735907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.735907Z digest=sha256:7aa83ec75751829bca61dcec6ab99c8ab1bb840984d4d9e44f3f887b3e8841e4

Observation 3af45c27-3863-4aec-ab9a-134255b2300e · inbound

A Systematic Analysis of Base Model Choice for Reward Modeling cites this paper.

A Systematic Analysis of Base Model Choice for Reward Modeling HelpSteer2: Open-source dataset for training top-performing reward models

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-15T21:09:01.271818Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:09:01.271818Z digest=sha256:739fa35340618fd5b8c808a100b1690455382ec0bae403dfb703633b48f37d04

Observation 8f717129-d5ef-4671-9290-c40b8efb86ff · inbound

J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge cites this paper.

J1: Exploring Simple Test-Time Scaling for LLM-as-a-Judge HelpSteer2: Open-source dataset for training top-performing reward models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-15T20:50:10.696490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:50:10.696490Z digest=sha256:af9dad8948a601881b0eed78c2cb3c1225bc4327b2e0ee83bb5c4cba7a95ec4e

Observation 93f23228-ef50-42f8-802c-ad68b2f37369 · inbound

Discriminative Policy Optimization for Token-Level Reward Models cites this paper.

Discriminative Policy Optimization for Token-Level Reward Models HelpSteer2: Open-source dataset for training top-performing reward models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T12:53:03.339487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T12:53:03.339487Z digest=sha256:bd7a5da33254f80505234a5e10e0b7d01200f7b72cbaddad288d1d051330266f

Observation e57198dc-bc3b-4e25-9d4e-e0450c9c8766 · inbound

TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence cites this paper.

TimeHC-RL: Temporal-aware Hierarchical Cognitive Reinforcement Learning for Enhancing LLMs' Social Intelligence HelpSteer2: Open-source dataset for training top-performing reward models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T12:27:50.908285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:27:50.908285Z digest=sha256:8858aae2119718844aa6250ca365e8796ab043d8366dc888958299e0b37cdb1d

Observation ad03ac79-0afa-486b-b655-aa3c4bee344f · inbound

RewardBench 2: Advancing Reward Model Evaluation cites this paper.

RewardBench 2: Advancing Reward Model Evaluation HelpSteer2: Open-source dataset for training top-performing reward models

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-05-19T11:22:16.733814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-19T11:18:03.965711Z digest=sha256:99d9bfb48fba497aa5a7fe4504587d058745843b91da3cf7bd99d0f865e118dd

Observation 977e5d76-02ea-4199-9eea-5075d5515872 · inbound

Pairwise Calibrated Rewards for Pluralistic Alignment cites this paper.

Pairwise Calibrated Rewards for Pluralistic Alignment HelpSteer2: Open-source dataset for training top-performing reward models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-15T20:48:01.973467Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:48:01.973467Z digest=sha256:2461879c82ef675a6d11001ccb860058618dc139508509bfc8df0185c3a5a1f2

Observation b3b23bd3-640a-4e84-89ff-091dd43c11d9 · inbound

PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization cites this paper.

PersonaFeedback: A Large-scale Human-annotated Benchmark For Personalization HelpSteer2: Open-source dataset for training top-performing reward models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T00:42:47.880878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:42:47.880878Z digest=sha256:515e5e00c2513dd2a8df1826ec5ff1bc8782333487a8d03016996092c5ef9982

Observation 0eb732b7-d282-465f-b157-e4328d374676 · inbound

SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models cites this paper.

SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models HelpSteer2: Open-source dataset for training top-performing reward models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T00:15:33.902602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:15:33.902602Z digest=sha256:3ee11699ab40b80c75ef1b18d0592e2a9a4c1a3e58baf527b1067c4c2228b43e

Observation 3b7fe163-9edf-44d3-8b08-d2fcf4f8311e · inbound

ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models cites this paper.

ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models HelpSteer2: Open-source dataset for training top-performing reward models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T19:23:55.065209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T19:23:55.065209Z digest=sha256:b1e9cc62249c37aa8ef73d0935685074a4a83a454b5e202252be85be01f479b8

Observation e077090a-7ba5-4c32-8c37-46c2b97c1ef3 · inbound

When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs cites this paper.

When Life Gives You Samples: The Benefits of Scaling up Inference Compute for Multilingual LLMs HelpSteer2: Open-source dataset for training top-performing reward models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T22:51:33.947555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T22:51:33.947555Z digest=sha256:d8619e76c1e46e46016e757f09ca191bc77a25a48cb417dabe2b23b263ca989f

Observation a415e80b-7a3e-428c-b68d-885bbdbf7a28 · inbound

OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique cites this paper.

OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique HelpSteer2: Open-source dataset for training top-performing reward models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-06T18:11:19.396424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T18:11:19.396424Z digest=sha256:71e88b3290ef23f4da87097c0b6434d452964cba2bbf372f0f10ac747d94c185

Observation 5be4873b-40e3-45a8-896b-91a648f1633d · inbound

Tiny Reward Models cites this paper.

Tiny Reward Models HelpSteer2: Open-source dataset for training top-performing reward models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T17:48:07.201291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T17:48:07.201291Z digest=sha256:05bae08fff7e1bca2e404c4f1b80ea58d0c158be59923d7619c42d2ad04bab7b

Observation ab21d6ac-d056-44f4-9ca7-01b06844b234 · inbound

Second-Order Bounds for [0,1]-Valued Regression via Betting Loss cites this paper.

Second-Order Bounds for [0,1]-Valued Regression via Betting Loss HelpSteer2: Open-source dataset for training top-performing reward models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T16:58:14.283812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T16:58:14.283812Z digest=sha256:1b7fa8fd19673e28f1c2d3df50bb194564641e35f1f560b1b787b65c367fb3f7

Observation abf26adc-4c7d-4de0-b06e-55ef50970bdd · inbound

Improving Large Vision and Language Models by Learning from a Panel of Peers cites this paper.

Improving Large Vision and Language Models by Learning from a Panel of Peers HelpSteer2: Open-source dataset for training top-performing reward models

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-05T12:27:27.632845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T12:27:27.632845Z digest=sha256:bb3a9c0c77365622a64588314f203885af710901e19dc9dc71123ebe908729cf

Observation bc0d8b94-5e21-4b50-841c-5a4a769fafd5 · inbound

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases cites this paper.

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases HelpSteer2: Open-source dataset for training top-performing reward models

Reference 2

Resolution
metadata mismatch
arxiv_id, observed 2026-05-16T17:21:07.946949Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-16T17:18:10.045283Z digest=sha256:660f73badf58fe653c7e70f26c9fbd5cc8a7cb8e7231e069af6992986cf5caad

Observation db8f3726-5db8-4eb9-b9e8-983974304b8c · inbound

PolyAlign: Conditional Human-Distribution Alignment cites this paper.

PolyAlign: Conditional Human-Distribution Alignment HelpSteer2: Open-source dataset for training top-performing reward models

Reference 67

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T15:08:33.613033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-06-27T06:38:55.992652Z digest=sha256:7f88df04de3057185cfaae4b36ab12aadd57bdf923d485be1134fc735777905e

Observation efbb4249-af8a-485e-903b-8c4416d37995 · inbound

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration cites this paper.

PEBS: Per-rater Empirical-Bayes Shrinkage for RLHF Reward-Model Calibration HelpSteer2: Open-source dataset for training top-performing reward models

Reference 18

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T18:55:58.586206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-29T01:26:00.228782Z digest=sha256:dbad33a0a765125a0b0da819cfa884288788c454a0c4a3d4980d049b42f9486d

Observation 26726097-ee01-4fec-bbb3-dc053c65c315 · inbound

Step-Level Preference Learning for Generative Agents in Social Simulations cites this paper.

Step-Level Preference Learning for Generative Agents in Social Simulations HelpSteer2: Open-source dataset for training top-performing reward models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-02T02:00:27.655165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T02:00:27.655165Z digest=sha256:126fade18dd693977f3965e9b82470813a911e6405447d4eaa8ad176a71fb9a3

Observation ff47f6f4-94a1-4420-ae85-74801ece0ce2 · inbound

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization cites this paper.

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization HelpSteer2: Open-source dataset for training top-performing reward models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-31T00:30:21.547440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T00:30:21.547440Z digest=sha256:3c623221a1781f43da5e92f36717c6f27351ea708d6636b1bf2eefb5949ae5b9