Pith. sign in

Paper Citation Record · LEDGER

Disentangling Length from Quality in Direct Preference Optimization

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2403.19159.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2403.19159 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 32 of 32 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-09T18:21:56.118350Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T19:40:07.153004Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation cd80fb21-6efd-4b9a-b2a4-3b7ed043da32 · inbound

Improving Inverse Folding for Peptide Design with Diversity-regularized Direct Preference Optimization cites this paper.

Improving Inverse Folding for Peptide Design with Diversity-regularized Direct Preference Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-05-23T19:05:46.916143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-23T19:03:53.675107Z digest=sha256:3011023834a06f0513bb5a18adcd5563be3bcd7fe264aa8f784029fdb6da6ed6

Observation 5919e0e6-9054-4882-822b-42af4f2dac01 · inbound

SimulPL: Aligning Human Preferences in Simultaneous Machine Translation cites this paper.

SimulPL: Aligning Human Preferences in Simultaneous Machine Translation Disentangling Length from Quality in Direct Preference Optimization

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-09T18:21:56.118350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T18:21:56.118350Z digest=sha256:dbc40569393e1c2030935018071674528745a8437505cff9c30c76778816901e

Observation 5bb56b2a-80fe-4d09-bf07-d307e47eea2f · inbound

Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling cites this paper.

Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling Disentangling Length from Quality in Direct Preference Optimization

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-09T17:46:29.235461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-09T17:46:29.235461Z digest=sha256:433ddf6ec1a3faba2dcf8e5e9f27d899d79b8747f2f9fe7a160577d50da96929

Observation ec8409b5-0173-49ee-9f53-106c5931d72c · inbound

LLM Alignment as Retriever Optimization: An Information Retrieval Perspective cites this paper.

LLM Alignment as Retriever Optimization: An Information Retrieval Perspective Disentangling Length from Quality in Direct Preference Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T04:08:51.815624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T04:08:51.815624Z digest=sha256:2a686142cf12a139425e651b217e449ee9def828d5905540e1658b5d69ef06db

Observation c94c4030-9263-4763-91fc-8508caf05beb · inbound

Design Considerations in Offline Preference-based RL cites this paper.

Design Considerations in Offline Preference-based RL Disentangling Length from Quality in Direct Preference Optimization

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-08T19:40:42.029675Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T19:40:42.029675Z digest=sha256:80e7746cc583fc404e759f22bce6f0deb20e51ee958930a5bf34fbd3641c14d7

Observation 5cc0fbaa-b4f8-4303-a375-4b58990c6ebf · inbound

DPO-Shift: Shifting the Distribution of Direct Preference Optimization cites this paper.

DPO-Shift: Shifting the Distribution of Direct Preference Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-08T12:17:45.959380Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T12:17:45.959380Z digest=sha256:0bbb129f4fb3a2a17d31af8c7a672dcd0cc68c65796f971385589bf91c2251d1

Observation fbf0c15e-e879-4f34-b07e-e854e4c04e5f · inbound

MPO: Multilingual Safety Alignment via Reward Gap Optimization cites this paper.

MPO: Multilingual Safety Alignment via Reward Gap Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T14:57:29.682556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:57:29.682556Z digest=sha256:e22c25356cb14e9d45621211d47e4823217f7e8f99214f72e086ea3e9bad7de2

Observation a76c2dc1-1aba-4b8a-88f1-67ae4cc22924 · inbound

MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework cites this paper.

MidPO: Dual Preference Optimization for Safety and Helpfulness in Large Language Models via a Mixture of Experts Framework Disentangling Length from Quality in Direct Preference Optimization

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T11:29:01.345378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T11:29:01.345378Z digest=sha256:89a8b5e00ffb12fe814debaf61b204a82051f70df55538ab43e32e6d51ffe44c

Observation ef4479f0-cb24-4db8-a1dd-270a815a3ae6 · inbound

Aligning Large Language Models with Implicit Preferences from User-Generated Content cites this paper.

Aligning Large Language Models with Implicit Preferences from User-Generated Content Disentangling Length from Quality in Direct Preference Optimization

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T10:50:52.110646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:50:52.110646Z digest=sha256:336152eb250a72f7a19eaa2d5d3f906624f6fb3f564b78bb5a4166d024952b19

Observation 7faebdb5-bce8-4568-9819-96e8c32d9373 · inbound

Unlocking Recursive Thinking of LLMs: Alignment via Refinement cites this paper.

Unlocking Recursive Thinking of LLMs: Alignment via Refinement Disentangling Length from Quality in Direct Preference Optimization

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T06:07:02.051648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T06:07:02.051648Z digest=sha256:ed3412baeda298ac746c744cf67cd28df80251df8a859963c5704b040b73bfe4

Observation 2444c89a-c34f-44c2-a429-af7a17a9eb79 · inbound

Explicit Preference Optimization: No Need for an Implicit Reward Model cites this paper.

Explicit Preference Optimization: No Need for an Implicit Reward Model Disentangling Length from Quality in Direct Preference Optimization

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T05:40:17.966403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:40:17.966403Z digest=sha256:638d535744215646e63a15dc4f233a05288cf94513bfc20c3375ffe9989837da

Observation 51e5e0f4-f6c6-48d5-9ce1-3c8eade8b949 · inbound

ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization cites this paper.

ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:14:44.113845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:14:44.113845Z digest=sha256:80760b0baad293428402d6a1044836f354ffc18f1b35437f062d90f7f933bd73

Observation 561a7e33-73f4-4e69-9cfa-a42e91b4fffd · inbound

Bridging Offline and Online Reinforcement Learning for LLMs cites this paper.

Bridging Offline and Online Reinforcement Learning for LLMs Disentangling Length from Quality in Direct Preference Optimization

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T22:28:07.964261Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T22:28:07.964261Z digest=sha256:43670a7b13c3e32e849595d548502123a0859c15b906649aef8f153c01caec5b

Observation fc58b32c-1150-498e-97fb-8a1730d2472d · inbound

Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap cites this paper.

Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap Disentangling Length from Quality in Direct Preference Optimization

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-05-21T23:50:47.708523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-21T23:46:24.208438Z digest=sha256:92e0940588eb8f856aa4f10a1dc3aca89dd17391c19f5001a6fde528f66db834

Observation 3cc6d8ee-4de4-4718-ae7a-cdf3005b8489 · inbound

Enhancing Small LLM Alignment through Margin-Based Objective Modifications under Resource Constraints cites this paper.

Enhancing Small LLM Alignment through Margin-Based Objective Modifications under Resource Constraints Disentangling Length from Quality in Direct Preference Optimization

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T21:33:14.576084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T21:33:14.576084Z digest=sha256:4fcc38eec636ebb7889c186c669eb76e864252cbdd7193113b8053f45be6c197

Observation 4a85e76b-341b-4052-832a-3d4680e1b659 · inbound

Multiplayer Nash Preference Optimization cites this paper.

Multiplayer Nash Preference Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-18T13:11:24.001156Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-18T13:09:54.433720Z digest=sha256:a06ad0a6df145d0b44d0883d82ab01912fca40277bc60fb169fee845ffcdfd62

Observation f71c7d4f-3a4f-42b5-899e-613e0bf4b900 · inbound

Factored Causal Representation Learning for Robust Reward Modeling in RLHF cites this paper.

Factored Causal Representation Learning for Robust Reward Modeling in RLHF Disentangling Length from Quality in Direct Preference Optimization

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-05-21T14:20:13.569063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-21T14:18:33.768962Z digest=sha256:cbb748fca062fcd6a9d664f16450d3942f1c00827934f67622a08f1737403368

Observation 89d6fd95-903d-42a4-a73f-dbddd0e393f0 · inbound

AlignCultura: Towards Culturally Aligned Large Language Models? cites this paper.

AlignCultura: Towards Culturally Aligned Large Language Models? Disentangling Length from Quality in Direct Preference Optimization

Reference 74

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T12:56:05.154961Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-10T02:36:36.854805Z digest=sha256:430208fe3b5b5c734d1459bf34a02f3cbe7e27ddeb2c4a8c29dfa34d91f7f2ec

Observation b2a2d5ec-c627-4f8c-985f-2ce357cd246b · inbound

Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models cites this paper.

Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models Disentangling Length from Quality in Direct Preference Optimization

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:20:41.700043Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-08T18:35:13.659698Z digest=sha256:f1b5e31a579d0039d7c7744d5d56354bf686fd4a95a7c5701952d00bbeb70d10

Observation 4ae7dc73-eaa8-434b-82b5-c44ced77521b · inbound

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization cites this paper.

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 25

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T17:56:05.480733Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-08T16:57:49.396570Z digest=sha256:cd7ba6223e9e88dd27deb04e4e04e3b2a95fc5b066cce99ea5933ca8fbd37cd8

Observation dcb49329-1564-43f4-98c1-f57db2b90c7f · inbound

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization cites this paper.

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 25

Resolution
metadata mismatch
arxiv_id, observed 2026-05-12T07:21:26.487774Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T03:26:54.426050Z digest=sha256:6cfcbf8d66276dbe9c15b9cd5b862579d4185cf2fccaa86713c743ebf0888c37

Observation 2910cfc1-58e0-4fb9-9087-1b443aeb8bef · inbound

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization cites this paper.

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 25

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T07:12:28.831414Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-13T07:08:39.328446Z digest=sha256:3c5b8b643dcfc8dfbc17ad6495c9084a333eb27403ecd4fe8ceb84b18440c5cb

Observation 12a70180-3549-4dcf-8df7-01cb3c4ee7cb · inbound

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization cites this paper.

RLearner-LLM: Balancing Logical Grounding and Fluency in Large Language Models via Hybrid Direct Preference Optimization Disentangling Length from Quality in Direct Preference Optimization

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-02T14:53:24.400757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T14:53:24.400757Z digest=sha256:ace098d9fccd979dc7fa34d6594e1823e97accdef53661b068952e58b8a2e3a4

Observation 7777d650-97ff-4cb3-bdd2-66774e0b157d · inbound

Response Time Enhances Alignment with Heterogeneous Preferences cites this paper.

Response Time Enhances Alignment with Heterogeneous Preferences Disentangling Length from Quality in Direct Preference Optimization

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T04:45:59.553809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-11T01:04:26.288913Z digest=sha256:9deb60afee832bf624e2fd37cb8b04d1d3d02373fc041ec98e60a59f3578f7f4

Observation abd32b47-9cb9-46ea-8461-5683afdb32b6 · inbound

Reinforcement Learning for Scalable and Trustworthy Intelligent Systems cites this paper.

Reinforcement Learning for Scalable and Trustworthy Intelligent Systems Disentangling Length from Quality in Direct Preference Optimization

Reference 101

Resolution
verified exact
arxiv_id, observed 2026-05-12T07:51:38.226241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-12T01:47:40.772146Z digest=sha256:c53ea9eb6170aebc165dc074763b24618af56e7fab07a1bfce552481ed25dafa

Observation 4915950a-6e37-4019-b487-ba51da449163 · inbound

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training cites this paper.

Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training Disentangling Length from Quality in Direct Preference Optimization

Reference 49

Resolution
metadata mismatch
arxiv_id, observed 2026-05-13T06:32:24.288800Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-13T06:30:51.812541Z digest=sha256:888a15f75b68f8569cd0955faecff296cc5c5d57335533c0587bd4e50f96b4f0

Observation 228e011e-8d83-4c58-a34d-0abd2e02fe4e · inbound

AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates cites this paper.

AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates Disentangling Length from Quality in Direct Preference Optimization

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-06-29T12:33:24.381122Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-06-29T12:29:55.729913Z digest=sha256:057663cd5b5b167634e40b0e495351eb35724c8ee3129da163920fb1bba0aa97

Observation e6b289a2-75ca-4e9f-b630-5d3ef85d82b5 · inbound

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation cites this paper.

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation Disentangling Length from Quality in Direct Preference Optimization

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-07-04T19:40:07.154736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-25T21:05:36.836361Z digest=sha256:ee2805458c5279a6dac075adc4571892910666f3456e11671b63ad90958cc826

Observation 8d9a76b1-c24c-4b06-8528-4ab91745e03a · inbound

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation cites this paper.

Brevity is the Soul of Inference Efficiency: Inducing Concision in VLMs via Data Curation Disentangling Length from Quality in Direct Preference Optimization

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-07-01T09:35:39.562457Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-07-01T06:30:27.178950Z digest=sha256:dd0fc30adc38dfc1d6f5fa34b60213cc65e00be0834c30eb5d79ef1d8168208a

Observation 67241da9-311f-417b-a35d-b930d892e7e1 · inbound

Multi-Turn On-Policy Distillation with Prefix Replay cites this paper.

Multi-Turn On-Policy Distillation with Prefix Replay Disentangling Length from Quality in Direct Preference Optimization

Reference 42

Resolution
unresolved
no resolver link, observed 2026-07-11T13:53:36.775836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-11T13:53:36.775836Z digest=sha256:46f78567a504ce33a43ae4c1c2f74c6f58bb4d3601a6c7f476fa6c8e31219bbf

Observation e9477601-761a-464d-ba86-7f81ed5390dd · inbound

Multi-Turn On-Policy Distillation with Prefix Replay cites this paper.

Multi-Turn On-Policy Distillation with Prefix Replay Disentangling Length from Quality in Direct Preference Optimization

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-02T08:40:35.672115Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T08:40:35.672115Z digest=sha256:aa4a1e2ca27d8a443ff447e123ca3e15842a80ebfef6f3e0a2b16fd8b3b11eb5

Observation 0f75957c-fcb7-430b-ad0a-edbae361afb7 · inbound

Test-Time Scaling via Error Localization cites this paper.

Test-Time Scaling via Error Localization Disentangling Length from Quality in Direct Preference Optimization

Reference 183

Resolution
unresolved
no resolver link, observed 2026-08-01T07:28:36.689869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-01T07:28:36.689869Z digest=sha256:bbeac22f59fb9821b371371fdc2334641a840332cc491847f56c42be74e1e42e