Pith. sign in

Paper Citation Record · LEDGER

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment

As of 21 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2505.12435.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.12435 v1

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:40:51.092593Z

measured 66 of 66 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

66 of 66 outbound references displayed

  • verified exact0
  • verified fuzzy1
  • unresolved65
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 3daead4f-b2b8-4a69-986a-f40a5f44846a · outbound

This paper cites online" 'onlinestring :=.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment online" 'onlinestring :=

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.787555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.787555Z digest=sha256:1f302a9a765461502a3fed3adffeafcac633749a4f4f2dfba6c36bec5de3a838

Observation 471db8dc-dc7a-4efc-ae10-251227468576 · outbound

This paper cites write newline.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.792034Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.792034Z digest=sha256:2956517ea3005967d525209cf8bb4f43ac9622a9617803db940041052f518e69

Observation 242e1644-c186-499d-8257-06c3c33462bc · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.798147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.798147Z digest=sha256:cd02f25e5615175037e11b35b2ebc8d440060e4e5e1b4cb1d3bac10f7cf45b18

Observation eb030c38-f58d-4ec7-acc3-9d46281e1ff9 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.802374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.802374Z digest=sha256:36ce1d30fca04bbf5ee2cc110fda97d8f3b6c5a00856b64109f93b9f944302ef

Observation 15c011cf-db3a-4cb5-be37-336a26bf220c · outbound

This paper cites A General Theoretical Paradigm to Understand Learning from Human Preferences.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment A General Theoretical Paradigm to Understand Learning from Human Preferences

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.806492Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.806492Z digest=sha256:f463cf1fd1a29f2797f29a63f898bdb2e2f7bd50122cdd76ff2832d80d7950f7

Observation 4f1163fb-4054-4734-b9d2-c770d6a7843f · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.810310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.810310Z digest=sha256:0890114ae34de1a1dca7683ffe28a836b33e536ad1cc071e9185af7cc4fb8237

Observation cb26f0d1-c64b-4224-a5c6-a1293c47d654 · outbound

This paper cites DeepSeek LLM: Scaling Open-Source Language Models with Longtermism.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment DeepSeek LLM: Scaling Open-Source Language Models with Longtermism

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.814418Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.814418Z digest=sha256:84898697570dd12703f4bf8112a603d9326be69b2e09b329b3d350bc1063fe7a

Observation 50cb692c-a232-41fa-ab4e-baea64a1708d · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.202520Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.818145Z digest=sha256:59779bb43f466ca720b8d656ebd6ade15c2f656a5128983990bcdf082d630bb3

Observation e7c1db1a-76ad-4499-b186-915f89c90781 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.188957Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.821666Z digest=sha256:07d02a0bfb720365554e1f006bc86c7d02dca5885f0ebb7de9487e2609a4617e

Observation 6dcde4ba-4f9d-4f36-bff6-14f2ee10ce64 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.169980Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.825083Z digest=sha256:f218f5b58ae772f41ef4e2ce1493331d43133017855628e6c24a189d65535d08

Observation 8c1eb1aa-7c0f-4795-9129-1c93642ab4f3 · outbound

This paper cites Sheng, Huaiyu Dai, and Dejing Dou.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Sheng, Huaiyu Dai, and Dejing Dou

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:40:52.154030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.828658Z digest=sha256:1f11ddd4f3de0e3a24989cedd844d1255352370f5d55b779b280cf69e0cb0ea5

Observation 5bce26c4-f3eb-4eab-9a1f-d769ef985db7 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.140887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.832240Z digest=sha256:a6489eeb9c5f4427b3e7001830576e077c76238d96039b3bb7b883965dab4b44

Observation 116b5ec6-b7b1-4a06-a2f3-92de6de188de · outbound

This paper cites Noise Contrastive Alignment of Language Models with Explicit Rewards.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Noise Contrastive Alignment of Language Models with Explicit Rewards

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.836712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.836712Z digest=sha256:14c294b2bb9a2da734556114bab2e7dd9782c5b26f29b6733d04afca07962d2f

Observation 94b237cb-c520-4d8e-ac12-01df6f1c74ad · outbound

This paper cites Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.840423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.840423Z digest=sha256:1502c87596dd5dacbb35535b9f97c25024aa9d3dc415c97f90ca66d3212ca07a

Observation a6d4f618-b656-4312-beb0-5df380dd9ed3 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Training Verifiers to Solve Math Word Problems

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.844143Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.844143Z digest=sha256:df25afe4e2491fb4810ffb1b2a5a762dff53ab67790983c7f99d3abd1cf22646

Observation 59f474a5-f2d2-46a8-afa8-4ca17752d813 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.847988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.847988Z digest=sha256:c2596e7f8fff0ce4bcf238712691a071872524f8a57c7fd0ce39af5dd62382c6

Observation f473829f-c119-4b41-816d-8ea4ab4ef353 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.852840Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.852840Z digest=sha256:2ceac99359b088869b28ed184fb93ff80414c3671efd99b467678c0866851f3a

Observation 2c946d99-1fd2-4baa-a825-94d7a8028475 · outbound

This paper cites Enhancing Chat Language Models by Scaling High-quality Instructional Conversations.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Enhancing Chat Language Models by Scaling High-quality Instructional Conversations

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.856604Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.856604Z digest=sha256:083a3e17132511d0dba90f4d0e0df5fbf4bbad7c572193ccc37ababe4de49cab

Observation ecb7e8e0-9952-40de-985d-ba8bbeacb3b9 · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.861519Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.861519Z digest=sha256:7f1166768552a9896724d89a3020d01f578ed551bfdab93c9577f52cf86ee04d

Observation def4e0e7-5314-4c03-98aa-0e9226a715c1 · outbound

This paper cites AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.867012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.867012Z digest=sha256:e1714af2efbc0565be53ca6989e2e633076acb0c0bb37f10c7048143b4c213e1

Observation 63efa318-3e9b-4326-8878-ef7c58462398 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.126768Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.873915Z digest=sha256:d69c30b050111eb2f75e184e418385107e4b4ef67461621fad81b25ce23d31b3

Observation dc60c685-346b-4bfd-84ad-f9d20e27992f · outbound

This paper cites KTO: Model Alignment as Prospect Theoretic Optimization.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment KTO: Model Alignment as Prospect Theoretic Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.878800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.878800Z digest=sha256:0391a04464d5d25c91d3d7f67e75cbfea4a2b3bec5efefcf63516c6bb6b10f6c

Observation 7a277e6e-d56e-45de-8967-eb401de4836a · outbound

This paper cites Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.883420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.883420Z digest=sha256:e97a60483aeb71482d4c8083a7fd54fb80f98b8d193777f0238cf4f6930f1d9c

Observation 33fdbbea-461d-46bb-a380-38e669142bb2 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.107987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.888201Z digest=sha256:76f4f23cce6ce36d297cc0e66eca03d9d1817984614a5855b7e176efe4b59ee3

Observation f4dfa443-3d81-45fb-9ef8-cdc03312dd05 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.092389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.892378Z digest=sha256:94dfcdb2ec60022333a434a2e8a7e334ac384c4e6a49ce8903dde3a8a6a65c4b

Observation 63839f5a-2dcf-4b47-84ee-314c01a29507 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Measuring Massive Multitask Language Understanding

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.898674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.898674Z digest=sha256:04378f823adc583cce0833b7fc35180e1180223be2974bb383d7a54723bff827

Observation bbb0a843-c63b-4c3f-872b-a31894efb4ca · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.064819Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.903456Z digest=sha256:0418a9c93f6f137c13e018ac9cfb58c0b9c2a259f2460274fecb32e03bf0d23d

Observation e737e666-7a83-4300-9e3b-36e2ea3d1156 · outbound

This paper cites ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.907728Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.907728Z digest=sha256:9d29ccb0456b6f689748457d3fa52604aa5f161e041d41b3cf81bb44faaf9589

Observation 64091380-0c4d-499a-88c7-2cc65c665442 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.048184Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.913755Z digest=sha256:6176f1faa7a7b8a241afb0a93478ae8f8acd2e7acf761509148bb52211ab6d1a

Observation 3d22dd6d-a93d-4c10-8afa-804870a03e2d · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:52.034963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.917328Z digest=sha256:d68accf3228171cb5208f8e5f7adfb6ad47005b3be25edc6dfc0c6549e5b6b8b

Observation 47a23641-f57b-43d9-9f82-e236fe6762c5 · outbound

This paper cites Binary Classifier Optimization for Large Language Model Alignment.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Binary Classifier Optimization for Large Language Model Alignment

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.925689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.925689Z digest=sha256:6fd13e8f51283917470d59c9d6c0a44aebecae13ed0369e239455ea031705367

Observation 86856a6b-6237-4af2-9633-b6e380071d78 · outbound

This paper cites Hashimoto.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Hashimoto

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.930298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.930298Z digest=sha256:e0ac6842cecd5b72e05e4f421ae50dad5c60ed6ba2d866d81ed4d999f8378c0e

Observation 6aa1d5a6-01f1-4674-ade9-824e5f66bcac · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.934357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.934357Z digest=sha256:bbe6da81592d6226cbe880d42c939081adda9c1c41c065c5da393381a738885d

Observation fb60a56a-9752-4689-b4d8-4aafc65577d5 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.997053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.938542Z digest=sha256:ed15351e7cb210204bbc2749a76ffcdf5714bcb5c47d67578831acd8de806b2a

Observation def9d6f1-f470-4624-9326-390d6ca74ff0 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 36

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.977717Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.942801Z digest=sha256:0a0394987e48149f97aeed52b0dfdffe4e1a17e08f3827be6b2dff9f22b1acbe

Observation 09bb4ae4-c9ce-4606-b18d-37193864672d · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 37

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.962086Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.946587Z digest=sha256:5c1b9430d6942154183ca05508dd4a99e220b0070786898746d396ef91a24057

Observation 1e676ca6-5bdd-43f4-8a58-c7692a3e7ea6 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.947236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.950791Z digest=sha256:e9b066a22c8ba5345a83094ad2781777a03f58ec54b35ba1699cd2f0808efec9

Observation c00ec4d0-b2ef-47a8-89a7-c607f7bf04b7 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.932469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.954528Z digest=sha256:73a302dc2b4e374e9285510122a7a75fc1ae7f43c8196d5db4873a872859adb5

Observation 0e12d145-60b5-4f3c-9dbe-a0d5970f7689 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 40

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.918412Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.958054Z digest=sha256:bf386b8dd4666421f79d259f9514d62b4281ef0a03e1d9c87c9493f841051f0e

Observation 84318b56-4c45-4301-9e8b-d638dcc0259f · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 41

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.897471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.962897Z digest=sha256:218705a92d4a08e5a85852707b74617012c4400d1ef44da5160707bea3d780ce

Observation 77eb1868-571e-4e4b-af4a-1eff649fad8c · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.882737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.966934Z digest=sha256:4b85fa739253a3f2f7e62640ffff578dfb1161a3bfa2e2efef7d43615488e06c

Observation 965d54b0-6259-4bf6-8fca-4ef0fe17f6b9 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 43

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.864918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.972276Z digest=sha256:86d339f976ddf4951aa5495b04932e03533ae339d8455deb9d1bef96fd49e9ca

Observation 942fabb0-3d12-44be-a1cb-3daa306aa7d5 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 44

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.851855Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:50.977632Z digest=sha256:2ddcf36530771d40005e18f8bca00591f2fcbdbf9fc602988c7a369a5ef0af77

Observation 74d4375e-5068-4b24-91ed-3e739cd9342e · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.982935Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.982935Z digest=sha256:68718e26125be4dab38cb545f80df8969d6e280a6345eb5ecc29bf1b3c64cc04

Observation 5e656f0a-fbf1-482a-b962-e892415a274b · outbound

This paper cites Length Desensitization in Direct Preference Optimization.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Length Desensitization in Direct Preference Optimization

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.986937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.986937Z digest=sha256:effa02a99a77815ca0434b8f717eeea70eb79c22afd7e7e5ea369372b655c27c

Observation 1b480cfa-c648-4d8d-bf96-ab522ba28b53 · outbound

This paper cites Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:50.995488Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:50.995488Z digest=sha256:5ecd87c94dad6f88df15c94cb0e44a3a1f54f578c68946da7e837e7c3f0233fa

Observation 12f518c5-463d-403e-a1ca-bd2d435be68f · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.834403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.000659Z digest=sha256:70a8c6bbf2fc5063b77c64007eebbce47cd3fc2ad61700ff403a1ad2e7645af9

Observation 92a9f314-f8e1-4876-961a-abe8abd24226 · outbound

This paper cites GPT-4 Technical Report.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment GPT-4 Technical Report

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.008119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.008119Z digest=sha256:510d5c75503224b5d2514b7af7176425f131d6183b45f6685ffd59a7a27e9c7c

Observation cb16990e-0a17-481b-b1cd-b241535b1e41 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.013546Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.013546Z digest=sha256:4695d7f83de53a027aa6c85e89770ff939bbf57c16328f18ec54c9badfeb6eda

Observation e8b78292-e152-469a-a2af-8456842ab2a8 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 51

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.809529Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.017748Z digest=sha256:b9be1ab8959ee80def65e9ca23c62447014fa836ef81bd960d84b0f7508fee18

Observation 49278843-dc57-447c-b1d9-14c11ea65aaf · outbound

This paper cites Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.022359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.022359Z digest=sha256:b05b4a65cbcbc65e3e0dd1e80227a76d620ffc6684bbd61355bbedfdd6afc87c

Observation 99f2fd35-6031-488c-b7f2-e0848ffc7eb8 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 53

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.782314Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.026456Z digest=sha256:7465694fa5719836a28866df0b48db423e2f7a9cb5a01144d38e4c5ed1fd90e2

Observation fdea8842-4847-4848-91b0-f0a4ad7b24d0 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.029963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.029963Z digest=sha256:3eafcec4b5b390a1210a9260bbd71eb91146babc6ec3b3c6582408c24f202755

Observation 8228630f-c1b9-4908-956a-89e889d6f0b3 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 55

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.755221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.033632Z digest=sha256:2e09162852d1177b03724b1ff118a3fa3ebb10a08f70bcf6d8d8e3933ed37b04

Observation 836d6584-7f24-43b1-8f1d-123a3089bf19 · outbound

This paper cites Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.037648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.037648Z digest=sha256:0015f06465e4b5c835b44ea02e7a30c1e994dba836ed81cda824c646cc5442a1

Observation 2d82d505-afad-4a68-8a06-0e1a47508402 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 57

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.734070Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.041091Z digest=sha256:70c4d69503c81d8f11db2dbca0c8353d12b7b09ea86ce06934b81492678192af

Observation e944a157-1092-4098-a144-fa2293b4a557 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.713537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.044923Z digest=sha256:9dc450466bfa744729a9303d0ff052f8a4244c0a2a1671606344dacc926e76e2

Observation a2e21f24-4ebe-4d3d-aea4-1331488718ff · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 59

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.692838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.048927Z digest=sha256:a761b01a6f56cb8b6248de5c671d7d280539747a2d378c23eadf5ef43b975ed7

Observation 4f1a5d66-53c4-4c68-9a19-fcee577037de · outbound

This paper cites Qwen2 Technical Report.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Qwen2 Technical Report

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.052531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.052531Z digest=sha256:b884051108631fecad236d59cba4f41124c485267ddb0f6cdb279ed39babd3b7

Observation 113a36c2-1c1d-4bd1-90a2-8ee91dc66bb3 · outbound

This paper cites Token-level Direct Preference Optimization.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Token-level Direct Preference Optimization

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.057004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.057004Z digest=sha256:156c223dc28067f0d48c7dcf641d490aefbadd0ab2fb99829d1ef5d7aba1b95e

Observation 1520b3a5-d711-4471-96b0-0b2f6239d878 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 62

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.676137Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.062418Z digest=sha256:55f4e6833b5710b289411344390dbfba1c6af0ac6ed1ae2382e25061d5ae7c1d

Observation a8cf8d9a-a90e-4cf7-b737-4486a5049f24 · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.068237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.068237Z digest=sha256:d1e5950d08e0e6772dc11e786e9b24bdc8aea4e09908b88bd643ae93663d93b7

Observation 0defa92a-6493-4a6c-9bc4-906b1bef0385 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 64

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.658062Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.075518Z digest=sha256:67f98119c62cb75ab24d9973932b067840f0bc180b8244619c69b2dcff7c6c05

Observation aaa0e2fa-95a2-4fb0-ab33-4a89672a7043 · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Instruction-Following Evaluation for Large Language Models

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-15T20:40:51.081237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:40:51.081237Z digest=sha256:2462651834a56cdb3eaab7bac8e9143c4c99c7e042842b1bdb1e454cc804115c

Observation 1affbfcb-9d5c-4c60-9272-42318ed6cca8 · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 66

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.640471Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.086789Z digest=sha256:10cc25a17e2d083e5d2a28f3e036fb7194d04c70bc3d8d2d253fab24c40d8d64

Observation 9f7743f8-2322-41ee-8229-9f1467dd42ad · outbound

This paper cites an unresolved cited work.

SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment Unresolved cited work

Reference 67

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:40:51.619564Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-15T20:40:51.092593Z digest=sha256:a8590faa8c085b974c870cb56d70fcb7478356c80095f23f1a043529073faa22

Pith citing papers

No inbound Pith citation observations are available.