Pith. sign in

Paper Citation Record · LEDGER

Data-adaptive Safety Rules for Training Reward Models

As of 12 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2501.15453.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.15453 v2

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T14:25:13.230661Z

measured 33 of 33 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T18:51:27.438057Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T04:19:34.990786Z

Reference resolution

31 of 31 outbound references displayed

  • verified exact0
  • verified fuzzy6
  • unresolved25
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2580469f-61db-4e46-bfda-2c09e04d1bf5 · outbound

This paper cites GPT-4 Technical Report.

Data-adaptive Safety Rules for Training Reward Models GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.088401Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.088401Z digest=sha256:a7f6c872a2d9a469fad9333a8071779c7d8b6d52c6b25df0a7d0ebccd6fd2d25

Observation 27bce344-63e0-43a5-b1e8-cf48a2dcc71c · outbound

This paper cites Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2.

Data-adaptive Safety Rules for Training Reward Models Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.142485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.142485Z digest=sha256:608f33604eea32338c72966b2cc031b850f1c388c1d7f5e7385c25ca57e7c95d

Observation 0094cbfa-69e6-4ce1-b644-a9f29f1420e6 · outbound

This paper cites {severe level} harm question:.

Data-adaptive Safety Rules for Training Reward Models {severe level} harm question:

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:25:13.756734Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T14:25:13.226125Z digest=sha256:bceca315bce97a39551141caad187647c8df186cb49ca554317c53ee1ea5b6fd

Observation f470421d-ab73-4e1c-b06d-bb39dce0e019 · outbound

This paper cites SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF.

Data-adaptive Safety Rules for Training Reward Models SteerLM: Attribute Conditioned SFT as an (User-Steerable) Alternative to RLHF

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.113800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.113800Z digest=sha256:b90d57ef1920fb3f4e056dfe48625378a0fb959bc89f20fa8d67d4722543af36

Observation cafb5bb8-e090-46e9-96e6-715b3ae5428a · outbound

This paper cites Quantile Regression for Distributional Reward Models in RLHF.

Data-adaptive Safety Rules for Training Reward Models Quantile Regression for Distributional Reward Models in RLHF

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.118759Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.118759Z digest=sha256:fe43fd2a385e8ceafc9856145a33052ceb42ee43b7ee339a8cb28360b0517fa2

Observation baeecbd7-6222-423c-bd54-a7e288f10e8e · outbound

This paper cites The Capacity for Moral Self-Correction in Large Language Models.

Data-adaptive Safety Rules for Training Reward Models The Capacity for Moral Self-Correction in Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.128436Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.128436Z digest=sha256:30dbcdaccc35e0426d8a3279a175fb3800bfa6240dc9c9819a027bca60c9f629

Observation 61ddd42a-ac36-44ab-bb67-176891b13f68 · outbound

This paper cites Improving alignment of dialogue agents via targeted human judgements.

Data-adaptive Safety Rules for Training Reward Models Improving alignment of dialogue agents via targeted human judgements

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.132837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.132837Z digest=sha256:a0502a7ca932b59f56472c34b72be00b02ea48a12b9af9da68f162f9a71ce05e

Observation 7fce955e-fa59-4530-816f-4f37da03cc29 · outbound

This paper cites Collective Constitutional AI: Aligning a language model with public input.

Data-adaptive Safety Rules for Training Reward Models Collective Constitutional AI: Aligning a language model with public input

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:25:13.815217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T14:25:13.137934Z digest=sha256:f45863c197d209a98f1cc0292069fbdfb819ca7abc052da9a842e02c6532f60f

Observation b12fa28a-d167-4fcf-aeb5-fa8ad8b9afc4 · outbound

This paper cites PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference.

Data-adaptive Safety Rules for Training Reward Models PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.146914Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.146914Z digest=sha256:f451b802ee0978c2b69b0db6677ca4d0e027cb21d0ead8199671f578153d4aad

Observation a941f6f1-daac-4ccd-922d-6c52dd840f81 · outbound

This paper cites Mistral 7B.

Data-adaptive Safety Rules for Training Reward Models Mistral 7B

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.151591Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.151591Z digest=sha256:abc81755e65ca1d4eb21d6454659da23c6ece792e0f20d8d97f4d58fba8c5276

Observation 778afdcc-4115-4c0f-a689-d5149d6a5281 · outbound

This paper cites Mixtral of Experts.

Data-adaptive Safety Rules for Training Reward Models Mixtral of Experts

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.155955Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.155955Z digest=sha256:07899fdc5f3106872719a302a99d2afd5c4e3799aee3891e0ccc2f1b26d5d1db

Observation 95b18964-317a-47b4-aff0-a183c9e5f0b2 · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

Data-adaptive Safety Rules for Training Reward Models RewardBench: Evaluating Reward Models for Language Modeling

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.165585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.165585Z digest=sha256:614f68b923afdccd8e5bb00ccf105e3fb737e6ce2f1817462954f315504f25e6

Observation 52271593-4ae9-48d8-9291-b2b50125b6ad · outbound

This paper cites Rule-based data selection for large language models.

Data-adaptive Safety Rules for Training Reward Models Rule-based data selection for large language models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.170124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.170124Z digest=sha256:97ec80ea9f147571bca0397763388e541288c8dbee53707774933bb1ec9f84b6

Observation b2119d49-2202-4e31-b9a1-0c82e0ae652b · outbound

This paper cites Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs.

Data-adaptive Safety Rules for Training Reward Models Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.174468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.174468Z digest=sha256:65d76fc2eca26c85c6db38007ef2f712941149721fc8cbcf92610cccfd3f3ce6

Observation 60177fe9-4da5-4bc5-9d79-4b58bed8ef16 · outbound

This paper cites Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown.

Data-adaptive Safety Rules for Training Reward Models Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.179261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.179261Z digest=sha256:781d9f113fe44ed5645661aa1e717a8e35a4a5cd3e7aac0756bd8b1d7227eae7

Observation 80ece55a-59bb-4ec9-ac52-06f13615a23a · outbound

This paper cites Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization.

Data-adaptive Safety Rules for Training Reward Models Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.188226Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.188226Z digest=sha256:9117a00705e0bd7965a8677be2b33b2935c33c3d9deed5d216e2ffa2be75cf3c

Observation 98c4542a-fc8f-46fe-a415-90a40a27d33f · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Data-adaptive Safety Rules for Training Reward Models Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.193055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.193055Z digest=sha256:c71c6f3958a312021a4940d4ed083ee31c5c4fe26e63eb46fc44660c2885e049

Observation 7a34b5fb-7a42-4c67-b238-2a08df5dd680 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Data-adaptive Safety Rules for Training Reward Models LLaMA: Open and Efficient Foundation Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.197665Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.197665Z digest=sha256:96fda516c5083cfd1990ac77ee842ce4d4cd0e2da39ad0754bbda8fe8d2aba4b

Observation 589cc8e1-0d44-499e-99c3-9300818f6f27 · outbound

This paper cites Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts.

Data-adaptive Safety Rules for Training Reward Models Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.202305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.202305Z digest=sha256:b3b8b6d6491d3442f0ae674cc178c44644c0199b528bbf2009a80ab697023074

Observation 15725ff4-32ee-4da2-80d6-910a317613ff · outbound

This paper cites HelpSteer2: Open-source dataset for training top-performing reward models.

Data-adaptive Safety Rules for Training Reward Models HelpSteer2: Open-source dataset for training top-performing reward models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.206994Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.206994Z digest=sha256:32aecd47c59bccb95280ae4c6c4bc249f066d279ab0ca200923de8d0eb69b80a

Observation a44391cd-317e-447f-a0d8-44b23ac6a679 · outbound

This paper cites SafetyBench: Evaluating the Safety of Large Language Models.

Data-adaptive Safety Rules for Training Reward Models SafetyBench: Evaluating the Safety of Large Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.211691Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.211691Z digest=sha256:7bd1bdfad3abde9653111743322f2086344e4afcbf7f0546ff4e77183444b636

Observation 9c4d6ac4-34cb-4be4-85e9-df16ad2ca076 · outbound

This paper cites − X t P+(t) logP+(t) # + 1 2.

Data-adaptive Safety Rules for Training Reward Models − X t P+(t) logP+(t) # + 1 2

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:25:13.788799Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T14:25:13.216632Z digest=sha256:40261fce3e96f7a357307424d12cc11589506a5aec9e266163bf8146bb8f3403

Observation e82345c2-ad06-45c2-b429-4143a1f3a7b1 · outbound

This paper cites 16 Proof of Theorem 3.4.

Data-adaptive Safety Rules for Training Reward Models 16 Proof of Theorem 3.4

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:25:13.771723Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T14:25:13.221460Z digest=sha256:eebd553fdb12284ea173b0d05bba443f0793cc77f984c95fd9e287b0024b5b57

Observation f9badda7-99c6-439c-8cfb-18042465e3b4 · outbound

This paper cites Results are averaged over 2 trained models with different random seeds for optimal hyperparameter selection.

Data-adaptive Safety Rules for Training Reward Models Results are averaged over 2 trained models with different random seeds for optimal hyperparameter selection

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:25:13.741166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T14:25:13.230661Z digest=sha256:b01f8e3d1e2b5e521381a54e8a637dc3948aadc52962c89b0c43856d7c8cc97b

Observation 2d4d4fd1-2249-4b0a-836a-59f9ed0a4bb3 · outbound

This paper cites Specific versus General Principles for Constitutional AI.

Data-adaptive Safety Rules for Training Reward Models Specific versus General Principles for Constitutional AI

Reference 1951

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.160754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.160754Z digest=sha256:1c08a00bb8e83b623a178f6c17d1b1917080248a9ba0eeb8a63c5932df5b3a59

Observation c8552f2a-d285-4119-a6c9-ee9beb47689c · outbound

This paper cites Language Models are Few-Shot Learners.

Data-adaptive Safety Rules for Training Reward Models Language Models are Few-Shot Learners

Reference 1952

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.108657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.108657Z digest=sha256:830ab215fb4fe553700b5c2e4506ed90df6eed82cb85ad9caa65fca4130ee925

Observation c0689ef8-c045-44ef-a253-98bd8de39d5f · outbound

This paper cites Llama 3.2: Revolutionizing edge ai and vision with open, customizable models.

Data-adaptive Safety Rules for Training Reward Models Llama 3.2: Revolutionizing edge ai and vision with open, customizable models

Reference 1975

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.183662Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.183662Z digest=sha256:82fe3649a8de6353435759923520f4d380529b8530dc76ee4a33bef9d911ca7e

Observation ba69f6bc-1fa7-4417-837c-fa5160970cdd · outbound

This paper cites The Llama 3 Herd of Models.

Data-adaptive Safety Rules for Training Reward Models The Llama 3 Herd of Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.123550Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.123550Z digest=sha256:c543ba0b8310247cc01761374e4162f7d48524d1809324f2bb01281b0c0b3840

Observation 88c204dd-5cdf-441e-b506-db0b9521d109 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Data-adaptive Safety Rules for Training Reward Models Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.103534Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.103534Z digest=sha256:bc9628a81cab0b70c9451a0608405efa437985d73d3c18443717cc919da1f50f

Observation c5ed5287-008a-404d-ba01-f8b749518143 · outbound

This paper cites Qwen Technical Report.

Data-adaptive Safety Rules for Training Reward Models Qwen Technical Report

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-10T14:25:13.098361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:25:13.098361Z digest=sha256:fdc226c1b69e8dc02b9539e4413b09c0fb17ef881259c04e61face319a0f1ebe

Observation 433e024a-c09c-44cd-898b-c5318d5171dc · outbound

This paper cites Llama 3.2: Advancing ai on edge and mobile devices.

Data-adaptive Safety Rules for Training Reward Models Llama 3.2: Advancing ai on edge and mobile devices

Reference 2025

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:25:13.832460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-08-10T14:25:13.093692Z digest=sha256:8fe078062f89a2ada57ff5bf9932551abdbce6d5c187fd4d6a4d88442bf86a7e

Pith citing papers

Observation 69708228-e735-41ca-9311-dc586d66fc1f · inbound

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary cites this paper.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Data-adaptive Safety Rules for Training Reward Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.438057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.438057Z digest=sha256:6e382be735e51733687392eb3ba57b37cc83bae36489e6191b7f30748994bc7e

Observation 26cf5ff7-62cf-458f-8a51-58f0d698fee8 · inbound

Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining cites this paper.

Automating SKILL.md Generation for Computer-Using Agents via Interaction Trajectory Mining Data-adaptive Safety Rules for Training Reward Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-07-04T04:19:34.992897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-26T17:02:30.696295Z digest=sha256:c98071fa5396928db1dbd5ae485bb90c3e639b86b7da7f88af40972112866c0b