Pith. sign in

Paper Citation Record · LEDGER

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs

As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2502.04357.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.04357 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T11:32:47.980568Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved30
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4ec1d8ef-30e2-4d74-a1e8-a9787bb5b65f · outbound

This paper cites Scalable Ensembling For Mitigating Reward Overoptimisation.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Scalable Ensembling For Mitigating Reward Overoptimisation

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.815161Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.815161Z digest=sha256:ab7a6dd329c38f76836a6fda5a43b75e4fe74beec8c7cb8efb8294ddff51ffeb

Observation a45fd102-318c-4a34-ac81-ab1bff7d3bb1 · outbound

This paper cites RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.848862Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.848862Z digest=sha256:1606116659695c81befbebd445a4ea140ca9362b093623816992907797880602

Observation 740ba855-2b7f-4785-8f0a-a938e5a28e0b · outbound

This paper cites RLHF Workflow: From Reward Modeling to Online RLHF.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs RLHF Workflow: From Reward Modeling to Online RLHF

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.854763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.854763Z digest=sha256:df524013597e2d4eb1fee3deaf323f30464ea04bd2d09ab524d6dfadbd25c9df

Observation 63b25d2b-3b20-4b58-be64-a4dc1fdbd324 · outbound

This paper cites Universal Language Model Fine-tuning for Text Classification.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Universal Language Model Fine-tuning for Text Classification

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.870940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.870940Z digest=sha256:78d3b137020744ba86101fe2333d325b88d138f81a37ccc01927888496440e0e

Observation 8dc45675-9d25-4c49-be35-f7f3e5710963 · outbound

This paper cites LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs LLM-Eval: Unified Multi-Dimensional Automatic Evaluation for Open-Domain Conversations with Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.892435Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.892435Z digest=sha256:126d24ca88508d9027dca327b1035082bd36939d4c11ee2ae4510534ae1066e4

Observation d8610c8a-67c7-4f11-894a-7304a70c704c · outbound

This paper cites Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.897367Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.897367Z digest=sha256:f8370909f18c09f464f5a2aefe7b7d884e4f8e11a7fbd034d114b4964e1c838e

Observation 93c01cb5-4458-43ae-9a23-55364f6abbff · outbound

This paper cites Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.903311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.903311Z digest=sha256:3b174694a824eff28d9c0cc9615d29889461b44a4998c26bc04bfadd79c413f0

Observation 5469c96b-8161-467c-ab2f-18e5acfa753a · outbound

This paper cites Generative Reward Models.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Generative Reward Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.909420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.909420Z digest=sha256:334119dbcb6e5b7739f55bbb063a1b857158e308b04b30db7f6a4b82974dbeb2

Observation 5d6b8332-5e9b-4309-bc3c-b8e45aa4390d · outbound

This paper cites Efficient Estimation of Word Representations in Vector Space.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Efficient Estimation of Word Representations in Vector Space

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.914729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.914729Z digest=sha256:c80888495bf47319be4202828d07030999d3197cbd66563400075ecac5bda506

Observation 535875a3-e053-4e8f-8882-9686a245d96a · outbound

This paper cites Active Preference Learning for Large Language Models.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Active Preference Learning for Large Language Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.920478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.920478Z digest=sha256:508518c1d71af84c5e1c0a24f7e6ddfdbaf6dc1b01be4187307fc06dc968a09d

Observation eb2610df-38d2-44ef-95a4-26cf73d61a6f · outbound

This paper cites an unresolved cited work.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-09T11:32:48.521803Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T11:32:47.932569Z digest=sha256:21c9436e27b973a381de30e2b9eda2da7568f7d5ea11c8fe7b247f0b5667f7ff

Observation 0376cf34-9ce7-4b62-a313-8f94310bd832 · outbound

This paper cites Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.943542Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.943542Z digest=sha256:c9c43c439faf6d6a9f9becb53569971bfacd592383d538855dbc9c225d2dcb38

Observation d499de53-74e5-4414-9332-c343e3d29346 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.948743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.948743Z digest=sha256:6d7c88d0e24b07442e79e43316f863bd5143d0821f3d17c829eb27191d1d529f

Observation ff9dfb75-04a8-4166-a8ae-d6d1ef3c2093 · outbound

This paper cites WaveNet: A Generative Model for Raw Audio.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs WaveNet: A Generative Model for Raw Audio

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.954111Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.954111Z digest=sha256:51bc7754511b541ee3cd82eb554f717116b2b9119c73c68d4c32039289ab4bf1

Observation e5842996-e851-443c-bc8d-630bf3aa9e5c · outbound

This paper cites Secrets of RLHF in Large Language Models Part II: Reward Modeling.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Secrets of RLHF in Large Language Models Part II: Reward Modeling

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.959132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.959132Z digest=sha256:32d2a54e7577c7f53226178728228b1e5bc214ef9d871584e017923a018e2be8

Observation 5d3c12fb-96dc-4564-94f4-9bdabdee110e · outbound

This paper cites Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.964012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.964012Z digest=sha256:667f6726ee8547553611aadcc3e466438908ce827a8b2771ce1e90674795967a

Observation 092df6bd-e88b-4aae-885b-4a2b3ff2ef0a · outbound

This paper cites Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Regularizing Hidden States Enables Learning Generalizable Reward Model for LLMs

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.969450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.969450Z digest=sha256:3e2e284d5342baf8b95c72ae088608d175bc9b9a6f0fc6aad95b2b62457e7310

Observation e0de104c-e2b0-423f-8b48-3982a8e8f688 · outbound

This paper cites Generative Verifiers: Reward Modeling as Next-Token Prediction.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Generative Verifiers: Reward Modeling as Next-Token Prediction

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.975340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.975340Z digest=sha256:842b7325ffbd964500261f63532f5b51ba84ce4eafa18a973678f5aa19878034

Observation 45a48ba9-d9d9-43f3-b378-08ce8b1b1ee4 · outbound

This paper cites Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Beyond One-Preference-Fits-All Alignment: Multi-Objective Direct Preference Optimization

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.980568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.980568Z digest=sha256:55a2fc2612acc458f9b1f38803668807fb3b7a055a98760d21df4960fa899d55

Observation e238bb2b-38b7-4b13-ba6f-0de4e32cb726 · outbound

This paper cites D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al

Reference 2013

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.826867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.826867Z digest=sha256:f40bccf216afd32316273d5e5db65c98808a7faa1d592df75d4ac7dd47711027

Observation da49c087-30ab-44db-a2ae-fcca4e1ecc80 · outbound

This paper cites Red Teaming Language Models with Language Models.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Red Teaming Language Models with Language Models

Reference 2014

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.937569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.937569Z digest=sha256:1646adc0c771c21a91ec200ec4feaa8d594c4672c2ef57d8a4421a44f3864f0d

Observation d98f3d92-adc3-4ff9-ade5-ae8b43c7dd97 · outbound

This paper cites Mitigating the alignment tax of rlhf.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Mitigating the alignment tax of rlhf

Reference 2015

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T11:32:48.540662Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T11:32:47.887158Z digest=sha256:2d0c7d01caf8dc079748da2b21f2561600550ba22b0586262d81de97d8c78cfe

Observation 93890cd6-f7ca-4de8-91e6-db57fbf7eceb · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 2016

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.865198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.865198Z digest=sha256:c34151892db150312767ea2d581ca8680eef7c0505cfcbab2688217ad492b50d

Observation 5258d64d-76db-48d4-accb-5a59a590a8eb · outbound

This paper cites Reward Model Ensembles Help Mitigate Overoptimization.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Reward Model Ensembles Help Mitigate Overoptimization

Reference 2017

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.837706Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.837706Z digest=sha256:944803e30aafb76c9355081d5e19a40297d9c1fb97deb5a483696c41dcd4cf14

Observation 84a95113-7295-4417-9801-6b5db597809e · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs LoRA: Low-Rank Adaptation of Large Language Models

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.876159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.876159Z digest=sha256:f25099255898206ca0f896e5b1eec1b52179dbb386346c30a63f6d961a3bb86e

Observation 8910208e-b3f3-44f8-a999-9658650905ba · outbound

This paper cites OpenAI o1 System Card.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs OpenAI o1 System Card

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.881802Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.881802Z digest=sha256:6574e46f41dd73791d730190dbc6bb327258387b4309811336fa2b8d12dc2513

Observation e7daa53e-fbc0-42f7-9b19-acbe282a8b69 · outbound

This paper cites Universal Sentence Encoder.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Universal Sentence Encoder

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.832124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.832124Z digest=sha256:518e7bfb525d4f81216012f20f750014c6d805b6924d39a68fcbdae75bee61cf

Observation 5702f126-caa3-4064-9d95-00667a1ce62f · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.821353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.821353Z digest=sha256:d09a4c8a4985615cf6ba0b98541f353659449521a7eb102e93c4c7c47a219bfc

Observation 54600f9e-9665-49c2-8dac-a1a8bb733340 · outbound

This paper cites OffsetBias: Leveraging Debiased Data for Tuning Evaluators.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs OffsetBias: Leveraging Debiased Data for Tuning Evaluators

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.926599Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.926599Z digest=sha256:4279124d17aadf9d3544bc0e0591c14a751c511a34038a7b6272f02863db4db5

Observation 911ebb87-91d6-44e2-b8eb-35204a5ed526 · outbound

This paper cites BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.843461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.843461Z digest=sha256:adf325cc9e10af9072cd6fcd3074c4cd030ac02bb9f99e256d667f92decfcd22

Observation 9e101d40-dd11-4c11-b33c-761b28fc3665 · outbound

This paper cites The Llama 3 Herd of Models.

Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs The Llama 3 Herd of Models

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-09T11:32:47.859773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T11:32:47.859773Z digest=sha256:bb24af913b9739a176b89000a569d334c0b130587b3d5d9342e8a9ccfafc26ba

Pith citing papers

No inbound Pith citation observations are available.