Pith. sign in

Paper Citation Record · LEDGER

Adaptive Margin RLHF via Preference over Preferences

As of 9 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2509.22851.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.22851 v4

Coverage vector

measured 69 of 69 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T14:52:27.322147Z

measured 69 of 69 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

69 of 69 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved66
  • parse uncertain0
  • malformed identifier2
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d26ae2f7-df07-4591-ab61-cb299ee78d85 · outbound

This paper cites Direct Preference Optimization with an Offset.

Adaptive Margin RLHF via Preference over Preferences Direct Preference Optimization with an Offset

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:18.602366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:18.602366Z digest=sha256:8797806fb9b6d7e3bec93936e579ca3eab545af24b88192f6802be79693dad39

Observation 4deb9cf5-bfb4-4a4e-a885-a13706c67041 · outbound

This paper cites A General Theoretical Paradigm to Understand Learning from Human Preferences.

Adaptive Margin RLHF via Preference over Preferences A General Theoretical Paradigm to Understand Learning from Human Preferences

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:18.668425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:18.668425Z digest=sha256:91545045c2dd4eab04a0ca83de86551cb672b3a125641b6ac44fd3c787e15017

Observation 40e0d324-70e7-478c-8376-f3279d3e5fbb · outbound

This paper cites Bousquet, S.

Adaptive Margin RLHF via Preference over Preferences Bousquet, S

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:18.815293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:18.815293Z digest=sha256:07fe666c3f9b1b2ff1b27b0e7eb8116b3dca49d2ce1ac08759e0d09085002d28

Observation 931f9ebc-bfbc-4231-8f18-1f5a1edb4f66 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:18.874694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:18.874694Z digest=sha256:c06221f2391bec28b6084143c545d6e1b9709d98dc48e633b3014ce24b3e9e41

Observation a0d963fd-66b3-4871-b322-c35f6d0c173c · outbound

This paper cites Burton, M.

Adaptive Margin RLHF via Preference over Preferences Burton, M

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.014491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.014491Z digest=sha256:7605d434e444cde706a6ac01b1132f6b7ae43db5aea3ad2b18baa40af0492461

Observation 32637181-00ce-4796-a516-eaa778829233 · outbound

This paper cites Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints.

Adaptive Margin RLHF via Preference over Preferences Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.102106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.102106Z digest=sha256:f3e61af4b34b828355c8fd43c80b97dd180c7de25dbe2159c5032eda07ef0d70

Observation b5410bf6-2633-4911-bb22-02f398f49f7f · outbound

This paper cites Cortes and V.

Adaptive Margin RLHF via Preference over Preferences Cortes and V

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.230754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.230754Z digest=sha256:3aea9eb6c3b768a549fb946bb0efd86b9e73cf2717ba429ac3f2828be9cda98c

Observation 5b0d4bfe-b7ad-411a-ac61-fff73e42d8f6 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Adaptive Margin RLHF via Preference over Preferences UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.341056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.341056Z digest=sha256:376c0b3bb5f780b1c33ed748815e261ed96ab24bd0b7ad2d2ae40c74822ed3fc

Observation 3e996b52-e079-416a-b208-9bc0465b48fd · outbound

This paper cites Safe RLHF: Safe Reinforcement Learning from Human Feedback.

Adaptive Margin RLHF via Preference over Preferences Safe RLHF: Safe Reinforcement Learning from Human Feedback

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.488335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.488335Z digest=sha256:af09e3f27d13772ae8073c67d6f10f3f42b0082784a9cbd79011bee08348aa77

Observation ffbc1c1f-7249-426c-9576-bb1c3d3078bc · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

Adaptive Margin RLHF via Preference over Preferences Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.641786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.641786Z digest=sha256:479b7cc3f681aaf6af9ee33c7913cdfe10a9bb1803cdad0937a27600ec01f081

Observation c9f67d72-0320-4973-874b-7c2fa63207ed · outbound

This paper cites Freund, R.

Adaptive Margin RLHF via Preference over Preferences Freund, R

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.721322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.721322Z digest=sha256:fd648cb8dce10807b0b71462ec7eb01144b87f6ec550d3a691bc66f972aa1691

Observation bdc8121d-fda6-4bc6-b99a-12aa39ffd21d · outbound

This paper cites Grattafiori et al.

Adaptive Margin RLHF via Preference over Preferences Grattafiori et al

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.829631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.829631Z digest=sha256:fa26e37d076d2c611dea36ec7bd0d4851fab45426bdbd8808c2b1055469121fc

Observation 2e7b1d4a-22e4-4918-a44a-4d50c35ee4ea · outbound

This paper cites Deep Ranking with Adaptive Margin Triplet Loss.

Adaptive Margin RLHF via Preference over Preferences Deep Ranking with Adaptive Margin Triplet Loss

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.927431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.927431Z digest=sha256:e5030a2573fbe5406883d019a4ea969bcf1f91a012bc978d5c2b5e3d5a6412b1

Observation b135e933-e8ff-4e02-a62b-2745286621fe · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.063810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.063810Z digest=sha256:c25ee78e7718b99bdb5fee3482e837a42a9f5ce807f747742c59d2436a5311f0

Observation 07170c3e-662a-4c99-8ea6-9f5da5ce5873 · outbound

This paper cites Herbrich and J.

Adaptive Margin RLHF via Preference over Preferences Herbrich and J

Reference 15

Resolution
verified exact
doi, observed 2026-08-04T14:53:21.597770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-04T14:52:20.143671Z digest=sha256:ac431b90f18ad588ed8ea3dce52285db7cb762940da2397c7e9abc01ff3b3f49

Observation 5cc9a423-2cf1-48c2-a280-0d7b0eabde7b · outbound

This paper cites Huang, Y.

Adaptive Margin RLHF via Preference over Preferences Huang, Y

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.216813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.216813Z digest=sha256:372c96dc22418e37f5cdd67c9e40a637dacd3fc074007c0abc111d2418a686ee

Observation bcb942e4-821c-45b6-b63f-d85de30a8e5b · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

Adaptive Margin RLHF via Preference over Preferences Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.301947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.301947Z digest=sha256:0350bc34c49d55aa3fc9c7fbd0262c7678483ce1cf27a09db6bd1167ae167638

Observation 7fa6e70b-4141-4aea-b59c-03c5577fc3fa · outbound

This paper cites Best-Worst Scaling More Reliable than Rating Scales: A Case Study on Sentiment Intensity Annotation.

Adaptive Margin RLHF via Preference over Preferences Best-Worst Scaling More Reliable than Rating Scales: A Case Study on Sentiment Intensity Annotation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.420279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.420279Z digest=sha256:b051393c9dffd6f39aea9edf0250550e31830cfb448acf9685f38132351d61f6

Observation 1e925bf3-af47-4214-bfe5-5b02f232054a · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

Adaptive Margin RLHF via Preference over Preferences RewardBench: Evaluating Reward Models for Language Modeling

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.583374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.583374Z digest=sha256:1df07ef87d89a60aa889f64a53a5ad003165e9a050da3d470e2f6ff5fd6d4b89

Observation aa2d5130-5b08-4c55-bbb2-df410334c849 · outbound

This paper cites Ledoux and M.

Adaptive Margin RLHF via Preference over Preferences Ledoux and M

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.699279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.699279Z digest=sha256:0dc9637b3f55facf1209169f86d7175356add767587f62181a0f80412d9d75af

Observation c0f3625f-7d29-4853-98e3-d2093ffff08a · outbound

This paper cites Ouyang, J.

Adaptive Margin RLHF via Preference over Preferences Ouyang, J

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.899020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.899020Z digest=sha256:ef48e9f639cec7b24a2cbb9d6bdacd204ee451e7542bb6c788f94cdaa888bf64

Observation ab919cad-b1d9-4238-8dfc-285aae93f89d · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.057847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.057847Z digest=sha256:b204969652cb0ab15707c24220b6456e9f46615ac8d488741a99a429df63b25a

Observation fa7afd46-3c23-46f2-9c88-84e69c0d9b98 · outbound

This paper cites Peters and S.

Adaptive Margin RLHF via Preference over Preferences Peters and S

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.262596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.262596Z digest=sha256:da2130992ac96197120dd81ceef6d69c8ca10b911e690bc8189e3487af2fb24b

Observation fdbcda8b-ed8c-43ae-9c2f-8b4c3593c9c2 · outbound

This paper cites Towards Understanding the Influence of Reward Margin on Preference Model Performance.

Adaptive Margin RLHF via Preference over Preferences Towards Understanding the Influence of Reward Margin on Preference Model Performance

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.427999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.427999Z digest=sha256:d5ec8b6caae1b2e4d4aa2276cdd20857c14aeca552973d763bec069c5451bbf1

Observation 3b0f04f9-5a26-44f5-aa62-e5839e6ae26b · outbound

This paper cites Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms.

Adaptive Margin RLHF via Preference over Preferences Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.625861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.625861Z digest=sha256:d7a3be57341e057a1201ee376f361e371fabddd32750b5e4207c6116f0e6b493

Observation 3d63d4ca-da49-4ff5-b230-8f1f9c880fcc · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Adaptive Margin RLHF via Preference over Preferences Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.762269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.762269Z digest=sha256:9377da84b6f107e6f4fbe328ce40baa31e30ecb49ad0df96a4f4a21cd0da6778

Observation 7e076658-0a5c-4316-a66f-74e70d1cae92 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.915511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.915511Z digest=sha256:3c8ca92fb3d74bd44e0e5063cbe24a641f70577dcc90532dfe2a2e2e0b830ea8

Observation 03cac645-6536-4014-9036-d4ab7967df3a · outbound

This paper cites Shalev-Shwartz and S.

Adaptive Margin RLHF via Preference over Preferences Shalev-Shwartz and S

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.048055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.048055Z digest=sha256:14fc0a9e35843149a9c14463e9a463804be5bab8f5542ba0c171da1a46137336

Observation b2c2bc61-a198-446a-9200-9fa6941cfa6a · outbound

This paper cites Learning to summarize from human feedback.

Adaptive Margin RLHF via Preference over Preferences Learning to summarize from human feedback

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.241257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.241257Z digest=sha256:162ead85c9c47b010b828842463b5706ed7b79324bf7ea3ebd4776fb9d08716f

Observation 35854391-623f-4756-b624-e2e1b12ea2ed · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.403138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.403138Z digest=sha256:64ae87765e9e26017ec51b89609b20fd886fe56538fd3311d477470571967ddc

Observation 62422090-11c8-440a-9b8b-5b9b17d101ae · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Adaptive Margin RLHF via Preference over Preferences Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.474124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.474124Z digest=sha256:9c744e67814c4ef1778fb23d89592f6ebae1a8922f1baa0ed73e8dcb62a64877

Observation ad48c468-41f6-4d02-b234-1c325540d4b9 · outbound

This paper cites Using Natural Language Explanations to Rescale Human Judgments.

Adaptive Margin RLHF via Preference over Preferences Using Natural Language Explanations to Rescale Human Judgments

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.663086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.663086Z digest=sha256:30afa0044b4285f16e0a02f810a7666619b2da0a0395f1fa900f45205a8e4f0c

Observation 6e2155e5-e488-4033-a71f-79949deb1a4c · outbound

This paper cites Secrets of RLHF in Large Language Models Part II: Reward Modeling.

Adaptive Margin RLHF via Preference over Preferences Secrets of RLHF in Large Language Models Part II: Reward Modeling

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.806003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.806003Z digest=sha256:9a2375ac364b10bd94481d606df8fc70ce8ec5271f4370086e9bb11e878308da

Observation 930e524d-670e-4629-90cb-11db64921b0a · outbound

This paper cites Reward Difference Optimization For Sample Reweighting In Offline RLHF.

Adaptive Margin RLHF via Preference over Preferences Reward Difference Optimization For Sample Reweighting In Offline RLHF

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.977912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.977912Z digest=sha256:72c2cb3ed9802b797e2007700dd09c35df18964d22f393da8a66cea8403879e1

Observation a8ebfb0e-6e6d-484e-99f7-8832427597a9 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.152384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.152384Z digest=sha256:383c6a058829db2bdfd39744a9b248167b0ee19e0932159539e71759f8c68830

Observation b4039719-d289-4f68-abe4-e1b8e027db86 · outbound

This paper cites HelpSteer2-Preference: Complementing Ratings with Preferences.

Adaptive Margin RLHF via Preference over Preferences HelpSteer2-Preference: Complementing Ratings with Preferences

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.416543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.416543Z digest=sha256:4936bce235dda45d0a2bd0b6abdf55330c172630b496d0162051bac5a27ebd05

Observation 9402494a-17ff-40a8-a70f-fee6e656ded9 · outbound

This paper cites AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization.

Adaptive Margin RLHF via Preference over Preferences AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.506011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.506011Z digest=sha256:e9699a46472d8cd1e5a4dcea4ba64a995cf537a25733b66171292ef974cfab08

Observation 34d1da5e-9660-4de1-8f71-242207ba596a · outbound

This paper cites $\beta$-DPO: Direct Preference Optimization with Dynamic $\beta$.

Adaptive Margin RLHF via Preference over Preferences $\beta$-DPO: Direct Preference Optimization with Dynamic $\beta$

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.688099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.688099Z digest=sha256:008d56c004124d9ac1ef077c7809649381d54336353c289a7c457780fdc679ee

Observation a7872236-7bbf-40f2-a2a6-75a9f0eeba6e · outbound

This paper cites Zhang, R.

Adaptive Margin RLHF via Preference over Preferences Zhang, R

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.753724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.753724Z digest=sha256:59e58e77c7d1584ce51ae12c0b46a69228ece320818d6097dc7ad2dcf6259020

Observation dca28929-3147-44b8-80dc-00812939bbea · outbound

This paper cites SLiC-HF: Sequence Likelihood Calibration with Human Feedback.

Adaptive Margin RLHF via Preference over Preferences SLiC-HF: Sequence Likelihood Calibration with Human Feedback

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.843777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.843777Z digest=sha256:1bcb25b750fe3c35e1085d29a7de6d1a90c40a1f0c090a1cfb8023720fa787a1

Observation 4195abd2-6dd2-466c-9378-df0b02df4e4e · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 42

Resolution
malformed identifier
no resolver link, observed 2026-08-04T14:52:23.913195Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.913195Z digest=sha256:08ecd0025b50219dd28d54f6e40081bcae8095790e294f9119b412481ce8d2e3

Observation 33823365-27bd-4322-a321-50012d02e943 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.005140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.005140Z digest=sha256:3e5a5f02904d0baafc398b12d83da918c556466affa5b3febdff3e4f4efbd802

Observation ba6ec33e-dac8-4464-aa14-a986278fc4ac · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.136944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.136944Z digest=sha256:f3a11f1be63ab6440e0313181ed227122c678cbbdd28944c4256744ce5d1b061

Observation ae76b861-3e3a-4385-bd13-6c4d87631726 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.264276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.264276Z digest=sha256:e54f590a24e6dfa7c3833c179f20aaadcf8abf200d72a40e63e79574c10e2f56

Observation b183f1b7-2860-4c41-9765-ed3591a2c7a1 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.415800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.415800Z digest=sha256:ffc1b01831d589616962651b68b7c2b8855125ac798ee37faa0d1cf58b0c2832

Observation becc15a5-a966-456d-8d73-6f5e5ae7094f · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.575574Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.575574Z digest=sha256:cd8fb41d5ea600771b0f9839c2e756b375a98a72a2a77b39b9fbc3f79da91610

Observation 18a40dff-31c5-4a95-99fd-589c4fa50ef3 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.676764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.676764Z digest=sha256:a6933b1df049952cf049bb57fcd72f61d93a43c866cb48efc410110fa01bbf06

Observation df5b5ed2-91a0-4b42-8d8f-32f52c2bc217 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.819696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.819696Z digest=sha256:2509d30b1bd2173af998fb839f1f4b9de9ad906a8eae89f6e7d4b44dd4634a5f

Observation 46703fff-72b9-4720-a0e6-e0bbc6f9801b · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 50

Resolution
malformed identifier
no resolver link, observed 2026-08-04T14:52:24.935392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.935392Z digest=sha256:0f058fca0018fcc5e2581071091b26eb9e86ca0db5e6dbed5f1ce76fbab1ef21

Observation 19396117-59ba-4b42-89df-68333583a515 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.028667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.028667Z digest=sha256:76ecbaec508d5b225c21f88324b6596fe1090c5c0b08dc142e5854a0f3de14bb

Observation 6c25a5f6-86cc-4ca9-958b-055af1d78953 · outbound

This paper cites Trailer Park.

Adaptive Margin RLHF via Preference over Preferences Trailer Park

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.184988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.184988Z digest=sha256:9342bea0107ef7423cf09632370b3020d9d5622a6c90b752fe73b51db0ddfbe4

Observation 0eacef87-9bdd-47b8-be7e-b47458e2265c · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.276801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.276801Z digest=sha256:036f7eb7d0a449d4767bb7abe4451206e4c26b8c71f588e6b7ba3a6ef9d85c86

Observation 4f33b784-df1c-4897-9197-736c156c6e89 · outbound

This paper cites It comes in various toppings including classic pepperoni but also more unique options such as cathead (a combination of prosciutto and arugula).

Adaptive Margin RLHF via Preference over Preferences It comes in various toppings including classic pepperoni but also more unique options such as cathead (a combination of prosciutto and arugula)

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.390652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.390652Z digest=sha256:e8fc4eba42cd2639dd144fae9eb2c8b3f0aa409c121ae57c2ad4032632c9e5ea

Observation 7d7a2a36-3ae1-4e81-a092-4ef92aa583cb · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.463887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.463887Z digest=sha256:81f80ea5f42950e86516e3e8c3ed22417f9f768ea3584149e5324f8a8a9050a7

Observation f0047949-78bb-42c4-bc94-29c180a70d5a · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.585139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.585139Z digest=sha256:3d40b61d7e8e13addbdfa0a586ee867c0bfcda2ba0db0b7a1d2ebfe104be1c84

Observation dd6a007a-d963-4e73-a11e-2c5528730d26 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.732076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.732076Z digest=sha256:381b6cea8a0acb5853fb17b3f82e3e19f98d8e2a0d1bc8bc7c27e999696ab651

Observation bd327419-9064-4441-8af6-cc07ab337fd8 · outbound

This paper cites These are just a taste of what Austin has to offer when it comes to street food culture.

Adaptive Margin RLHF via Preference over Preferences These are just a taste of what Austin has to offer when it comes to street food culture

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.833263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.833263Z digest=sha256:fbd75dc4f3febd2f1250d9dd319380ba7e0e6e7e47927afabdc3e24b6b4cb645

Observation 43a863ae-88c2-437f-a5b5-9639a4e27c6a · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.929612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.929612Z digest=sha256:3af310d1a70182413bec9c04b9930ca6e13fbc73596c48cc58f8d1bfa0dc337f

Observation 1b523c27-65b4-49c9-aa95-71dd2e7c5d37 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.034237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.034237Z digest=sha256:51f86b674fb36b45c00f70245e709db9a5557ef622c8a2a822849034ae077c74

Observation 80c953cb-459c-4c94-bb2d-d88893718526 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.120585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.120585Z digest=sha256:8360dc1771fdd911f7fc461f9783bf8ff8f053d293a8c4044838b377d38d4d19

Observation 80241729-884a-4899-a568-d88f50667a00 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.249371Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.249371Z digest=sha256:bf46a3e9d2c6e7a48718609c6d874e561deffb7e6f5a4a39083ab583e711eef7

Observation 42c6f05d-10b4-494e-83b3-bee6ed28f842 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.362875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.362875Z digest=sha256:d62184375144b277c4866df6da0e41e3720cfee5d0b0daa365f1f33a4adc3263

Observation 28510f25-63f7-410c-94b6-ecd3adb4bb55 · outbound

This paper cites Big As Yo´Face.

Adaptive Margin RLHF via Preference over Preferences Big As Yo´Face

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.511683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.511683Z digest=sha256:0d6bde9e56835d2d8380960f73e985c2c802f9e32f1a06f1eedbe7f467959e9d

Observation 62559684-b2ae-41ab-aea6-8b968a5a706c · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.714613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.714613Z digest=sha256:55f0c3b363078ad31334e4dd990ec180a7b35dae12e77bf3f145329e42eb28cf

Observation 600040fb-d03d-4019-8689-363ce8530dba · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.922954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.922954Z digest=sha256:cea0773f9e3159abe1863a0b92a2c65c4ac32944484d8c020852fd72b6651545

Observation cb8e8394-cc1c-4420-8ac0-4f9e068db294 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:27.059039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:27.059039Z digest=sha256:499e3876c1cc754ad7386e258bf1222e14434715f15588867fce7747ddc8956c

Observation a5b037e6-d769-4eca-9431-eee23b86fe8c · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:27.204351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:27.204351Z digest=sha256:8327b8936b56d8cd2496f14caa6429bdd6d29f412af50a878c70ecaf9ef4c110

Observation 7fb140ae-8efa-435e-8c29-f93029f42f82 · outbound

This paper cites Lion Burgers,.

Adaptive Margin RLHF via Preference over Preferences Lion Burgers,

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:27.322147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:27.322147Z digest=sha256:54c6c83ef223d88d789351551d1b04f7b9e041e5818cae6fad01725f1082d416

Observation cc987b26-76a4-4d61-82ee-429d539bd995 · outbound

This paper cites HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM.

Adaptive Margin RLHF via Preference over Preferences HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.326087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.326087Z digest=sha256:637a65286136056b05b177c37df0ee47bc1ce74ebaa20ed7ee5953270496402b

Pith citing papers

No inbound Pith citation observations are available.