Pith. sign in

Paper Citation Record · LEDGER

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning

As of 13 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2501.15109.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.15109 v1

Coverage vector

measured 21 of 21 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T14:39:22.659889Z

measured 21 of 21 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

21 of 21 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4cb1b3ab-7199-469d-8200-1ade5491316f · outbound

This paper cites Enhancing Chat Language Models by Scaling High-quality Instructional Conversations.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Enhancing Chat Language Models by Scaling High-quality Instructional Conversations

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.570129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.570129Z digest=sha256:efb6e2e96ecf3a790f9a5d8d4232d5a3b907b67edd9926bbe00cd18007d79830

Observation e204ea03-bab1-452c-9ab4-91cbacbf35f0 · outbound

This paper cites The Llama 3 Herd of Models.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning The Llama 3 Herd of Models

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.575009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.575009Z digest=sha256:6d273e412eadf2cad538f85f4b5d7706dea7490ff337b8f252fb03a4b99e58be

Observation 12b3a973-da04-4eee-9de3-ba597e5fcc34 · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning KTO: Model Alignment as Prospect Theoretic Optimization

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.580488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.580488Z digest=sha256:842a59c11682c5fa70f3a729ed32e23755a4c35047cea361417c299d4ec55d76

Observation 778039a5-bf25-4cb2-a026-57d5f990d648 · outbound

This paper cites Impact of Preference Noise on the Alignment Performance of Generative Language Models.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Impact of Preference Noise on the Alignment Performance of Generative Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.585488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.585488Z digest=sha256:7e82cd18e2e6ded4ad56c5c38ba5ba49cc4db0de45ef1524c80f31faf6488af1

Observation 96893a3d-cb9f-4d0f-8f3b-37b860da39a1 · outbound

This paper cites Towards Comprehensive Preference Data Collection for Reward Modeling.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Towards Comprehensive Preference Data Collection for Reward Modeling

Reference 7

Resolution
metadata mismatch
local_arxiv, observed 2026-08-10T14:39:22.888258Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T14:39:22.591220Z digest=sha256:eea59d9398f43691a0a0f16146e90d5751c1531e6f9aa23530453ea49309536c

Observation eb394745-d226-4486-8f3d-34dce92d2ff2 · outbound

This paper cites In Proceedings of the 2023 Conference on Em- pirical Methods in Natural Language Processing , 9187–.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning In Proceedings of the 2023 Conference on Em- pirical Methods in Natural Language Processing , 9187–

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T14:39:22.988101Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-08-10T14:39:22.596666Z digest=sha256:4e69b0adfa9ec7315290137cc1b3dac46952991fce220d450748eb70c2107c8b

Observation 6374e27e-381f-473f-b62b-d321476f14b0 · outbound

This paper cites One-Shot Safety Alignment for Large Language Models via Optimal Dualization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning One-Shot Safety Alignment for Large Language Models via Optimal Dualization

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.601279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.601279Z digest=sha256:1c0e698560935e75e1f5c9ced51daef8ae3db075226944ab25bdd44208f8a5a6

Observation bd44d406-4f46-49e3-be8d-c303673f55ad · outbound

This paper cites Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.605842Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.605842Z digest=sha256:4e2f7393aa4c57e0b25e9d76c135996d7113dafdf538e8bd625b02f23a178b54

Observation d9f28792-0da2-4476-8710-094a050b3e65 · outbound

This paper cites Mistral 7B.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Mistral 7B

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.610940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.610940Z digest=sha256:4e1dad69094e679d2492c179b9df9033e80c27caaf3a4467c1d9d1bdea823147

Observation 5348c521-0ea4-4238-b262-f561f98c6ff4 · outbound

This paper cites A Survey on Human Preference Learning for Large Language Models.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning A Survey on Human Preference Learning for Large Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.615302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.615302Z digest=sha256:5acf0d26b951fbb8b1351027454108632fc6ad99dd6d1216165cbdd22b8e3518

Observation 5a792d65-1c92-4d01-9816-18e06630e5f7 · outbound

This paper cites Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Spread Preference Annotation: Direct Preference Judgment for Efficient LLM Alignment

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.620676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.620676Z digest=sha256:14954da2cd3238e1ce84a99d15d8fb977b03585eeb47a0642ce8fb36df1113a8

Observation 624eec9c-f1d9-41f5-b2a7-b2eedc21ec2d · outbound

This paper cites From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.625907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.625907Z digest=sha256:7056aa4216e6d0e87e0a791928bf0bd400ed9739e0032f7bc8f82eff4c180598

Observation 3d3bb5d8-2270-436a-ab72-33a6e358a940 · outbound

This paper cites Statistical Rejection Sampling Improves Preference Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Statistical Rejection Sampling Improves Preference Optimization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.630705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.630705Z digest=sha256:9a7b56d5ab037b6a237d01bbe3f7bdca38a2e630ba7cb37908e8f6ca6a48e5f8

Observation df0fb837-b648-4b15-9f59-646e4f21287a · outbound

This paper cites Enhancing LLM Safety via Constrained Direct Preference Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Enhancing LLM Safety via Constrained Direct Preference Optimization

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.636132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.636132Z digest=sha256:022275ca3f986f21e0955e24be7b3b46fd873061fef9f2c39a30523a152e2d2a

Observation 8b442214-fe35-4712-80ef-f6a06e762b45 · outbound

This paper cites Adapting Large Language Models for Content Moderation: Pitfalls in Data Engineering and Supervised Fine-tuning.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Adapting Large Language Models for Content Moderation: Pitfalls in Data Engineering and Supervised Fine-tuning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.640623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.640623Z digest=sha256:c7daec54c47a697a1589b67230da6ee77140c513ce1c49cbd9785bc9f55c837a

Observation d7dacf60-509c-4f74-a326-58e84b29d054 · outbound

This paper cites SimPO: Simple Preference Optimization with a Reference-Free Reward.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning SimPO: Simple Preference Optimization with a Reference-Free Reward

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.645558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.645558Z digest=sha256:7595de0af8618f8b5023569b8866ae2b09c5a9a9807d71f3485978cec2a74a4b

Observation c152b506-7f2b-42cf-8134-ac543e973363 · outbound

This paper cites Filtered Direct Preference Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Filtered Direct Preference Optimization

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.650320Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.650320Z digest=sha256:8b97946f539c94cb91a6ac5ec24ee9caef084f944c0ed7da679d34fe28c808f3

Observation d5707e30-3e9c-4230-8576-05f25e428de8 · outbound

This paper cites Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.654858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.654858Z digest=sha256:3894561ea3ac25ea3a4f79fc0c3af183c782c1574c51d6357977c80d7dc826a9

Observation a60a2d6f-201c-476f-8f32-95acc3e726bd · outbound

This paper cites AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.659889Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.659889Z digest=sha256:0442d05e2660ddbeccf93ad30573bfd0909eb96b5fc4091daa2da87421adf8da

Observation d0c11f7f-e6a5-45f9-af30-f6f10cd69af9 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.565369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.565369Z digest=sha256:50d9bac51cd29fd8b9f067fff894ef564a43015218e21c7d8620728ebfbaa79f

Observation 86a11f2f-4317-4f7d-8b69-1c7f9e50bc3c · outbound

This paper cites Provably Robust DPO: Aligning Language Models with Noisy Feedback.

Clear Preferences Leave Traces: Reference Model-Guided Sampling for Preference Learning Provably Robust DPO: Aligning Language Models with Noisy Feedback

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-10T14:39:22.559926Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:39:22.559926Z digest=sha256:706b5e4bce86057c38864866f745c31a029a86e02a4ecd1b2585731a2e6a058d

Pith citing papers

No inbound Pith citation observations are available.