Pith. sign in

Paper Citation Record · LEDGER

Adaptive Margin RLHF via Preference over Preferences

As of 21 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2509.22851.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.22851 v4

Coverage vector

measured 69 of 69 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T14:52:27.322147Z

measured 69 of 69 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

69 of 69 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved66
  • parse uncertain0
  • malformed identifier2
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d26ae2f7-df07-4591-ab61-cb299ee78d85 · outbound

This paper cites Direct Preference Optimization with an Offset.

Adaptive Margin RLHF via Preference over Preferences Direct Preference Optimization with an Offset

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:18.602366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:18.602366Z digest=sha256:0c7286713609842c6b222c022063932fdcf3552329cc8b1cf8b90f3eea888f8e

Observation 4deb9cf5-bfb4-4a4e-a885-a13706c67041 · outbound

This paper cites A General Theoretical Paradigm to Understand Learning from Human Preferences.

Adaptive Margin RLHF via Preference over Preferences A General Theoretical Paradigm to Understand Learning from Human Preferences

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:18.668425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:18.668425Z digest=sha256:5cd29edd44689154a32b1c2891da6ff0ff21b3f705c0199afbd1c7fb30eaef38

Observation 40e0d324-70e7-478c-8376-f3279d3e5fbb · outbound

This paper cites Bousquet, S.

Adaptive Margin RLHF via Preference over Preferences Bousquet, S

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:18.815293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:18.815293Z digest=sha256:d1a708f4cbb48f15afd7c5ce3f57511b99831e7469c9c3a2eea3638553829dcc

Observation 931f9ebc-bfbc-4231-8f18-1f5a1edb4f66 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:18.874694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:18.874694Z digest=sha256:6e95f119568df346f1da6f6ae2664764a57be46b42d79f46db470d0b63a8ce30

Observation a0d963fd-66b3-4871-b322-c35f6d0c173c · outbound

This paper cites Burton, M.

Adaptive Margin RLHF via Preference over Preferences Burton, M

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.014491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.014491Z digest=sha256:13966bf8a731e6b07d98c3d7761a43f61b770d4e6ba6ed4d5516ef13c7701811

Observation 32637181-00ce-4796-a516-eaa778829233 · outbound

This paper cites Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints.

Adaptive Margin RLHF via Preference over Preferences Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.102106Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.102106Z digest=sha256:5a279869e05f0f069a485be436edb83c8baf5155e971fabc4d4a15e10fb7ef3a

Observation b5410bf6-2633-4911-bb22-02f398f49f7f · outbound

This paper cites Cortes and V.

Adaptive Margin RLHF via Preference over Preferences Cortes and V

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.230754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.230754Z digest=sha256:817dc2efb544390a46719b8ffc6f7d1858c14eb994452bd8cc49b937392cf8e5

Observation 5b0d4bfe-b7ad-411a-ac61-fff73e42d8f6 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Adaptive Margin RLHF via Preference over Preferences UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.341056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.341056Z digest=sha256:1860a787fef53e80b6873453f3012fc33e450f888a1518dbfd0040594c380620

Observation 3e996b52-e079-416a-b208-9bc0465b48fd · outbound

This paper cites Safe RLHF: Safe Reinforcement Learning from Human Feedback.

Adaptive Margin RLHF via Preference over Preferences Safe RLHF: Safe Reinforcement Learning from Human Feedback

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.488335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.488335Z digest=sha256:f0817f92e80bcea679139130c42b1a399ba9bfc13167668ab994a86340fb7a1d

Observation ffbc1c1f-7249-426c-9576-bb1c3d3078bc · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

Adaptive Margin RLHF via Preference over Preferences Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.641786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.641786Z digest=sha256:dc2e40f8e406fa77efb7cdbb34315cc66f002c5d2b41f1c8a881615318579409

Observation c9f67d72-0320-4973-874b-7c2fa63207ed · outbound

This paper cites Freund, R.

Adaptive Margin RLHF via Preference over Preferences Freund, R

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.721322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.721322Z digest=sha256:3e4e36b2625cadc344aca4bb5dc707ae48b3b4a76bff84dc61eac998eb374251

Observation bdc8121d-fda6-4bc6-b99a-12aa39ffd21d · outbound

This paper cites Grattafiori et al.

Adaptive Margin RLHF via Preference over Preferences Grattafiori et al

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.829631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.829631Z digest=sha256:89b4ab3481f6202718f533d6d3bac204ca56b84dda861e30ff543ea928abf65b

Observation 2e7b1d4a-22e4-4918-a44a-4d50c35ee4ea · outbound

This paper cites Deep Ranking with Adaptive Margin Triplet Loss.

Adaptive Margin RLHF via Preference over Preferences Deep Ranking with Adaptive Margin Triplet Loss

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:19.927431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:19.927431Z digest=sha256:b6a58f1a58f2497cb2fd47cd76e8647e45d87ae8cbd58e85d4f3c76e13a3aec6

Observation b135e933-e8ff-4e02-a62b-2745286621fe · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.063810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.063810Z digest=sha256:c1c63045a96031d7568f74271a4ee047b3e95d95612393a69412baa95513e999

Observation 07170c3e-662a-4c99-8ea6-9f5da5ce5873 · outbound

This paper cites Herbrich and J.

Adaptive Margin RLHF via Preference over Preferences Herbrich and J

Reference 15

Resolution
verified exact
doi, observed 2026-08-04T14:53:21.597770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-04T14:52:20.143671Z digest=sha256:85edac7d8074e7709819b09f5269c8f09abb2cbd0687702c9f897be02f256f7e

Observation 5cc9a423-2cf1-48c2-a280-0d7b0eabde7b · outbound

This paper cites Huang, Y.

Adaptive Margin RLHF via Preference over Preferences Huang, Y

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.216813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.216813Z digest=sha256:e9e214b502e1b6af22ac373bf50f1751ecf652e80d8d39dc7d8e219b6427798c

Observation bcb942e4-821c-45b6-b63f-d85de30a8e5b · outbound

This paper cites Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog.

Adaptive Margin RLHF via Preference over Preferences Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.301947Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.301947Z digest=sha256:de9092cb28d2094b84d68b7b38172d853d3fcb6b0940918fb17b8f4d0ec15a37

Observation 7fa6e70b-4141-4aea-b59c-03c5577fc3fa · outbound

This paper cites Best-Worst Scaling More Reliable than Rating Scales: A Case Study on Sentiment Intensity Annotation.

Adaptive Margin RLHF via Preference over Preferences Best-Worst Scaling More Reliable than Rating Scales: A Case Study on Sentiment Intensity Annotation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.420279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.420279Z digest=sha256:be88490dbff1189fdfb2dfaa83add1fac1120333cb3b8c08dedc689ded4db653

Observation 1e925bf3-af47-4214-bfe5-5b02f232054a · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

Adaptive Margin RLHF via Preference over Preferences RewardBench: Evaluating Reward Models for Language Modeling

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.583374Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.583374Z digest=sha256:f3a7b9294da089745d3a5ce9d369e21527088ebba699a62bd3bc7b60c2996cbb

Observation aa2d5130-5b08-4c55-bbb2-df410334c849 · outbound

This paper cites Ledoux and M.

Adaptive Margin RLHF via Preference over Preferences Ledoux and M

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.699279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.699279Z digest=sha256:7bc3a542b2cff043e0ea9f385de5a987fddbd961c04fa2803f7906f3d655d01d

Observation c0f3625f-7d29-4853-98e3-d2093ffff08a · outbound

This paper cites Ouyang, J.

Adaptive Margin RLHF via Preference over Preferences Ouyang, J

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:20.899020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:20.899020Z digest=sha256:7c76aafd4ead60ff27a3c3226b9293ee3446773344dc479b0ad55ad81a173477

Observation ab919cad-b1d9-4238-8dfc-285aae93f89d · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.057847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.057847Z digest=sha256:593dd7e13fdd9f519d2cae0fd44e27b148ed23fa5780a1789846135a2f2a59d2

Observation fa7afd46-3c23-46f2-9c88-84e69c0d9b98 · outbound

This paper cites Peters and S.

Adaptive Margin RLHF via Preference over Preferences Peters and S

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.262596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.262596Z digest=sha256:6ef6007e917cd37ea3fc4f352549fb0f7a6a7f80963ddedb725401a0e8b085af

Observation fdbcda8b-ed8c-43ae-9c2f-8b4c3593c9c2 · outbound

This paper cites Towards Understanding the Influence of Reward Margin on Preference Model Performance.

Adaptive Margin RLHF via Preference over Preferences Towards Understanding the Influence of Reward Margin on Preference Model Performance

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.427999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.427999Z digest=sha256:390e90436a7d2de8c694a3b77fb0597b5f41bcd39949d4a1010875373cb3e15f

Observation 3b0f04f9-5a26-44f5-aa62-e5839e6ae26b · outbound

This paper cites Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms.

Adaptive Margin RLHF via Preference over Preferences Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.625861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.625861Z digest=sha256:6f4efa2d5a98f71ce4aba22f295f6a47ef505061c7d17134155b0cf845c15ff3

Observation 3d63d4ca-da49-4ff5-b230-8f1f9c880fcc · outbound

This paper cites Direct Preference Optimization: Your Language Model is Secretly a Reward Model.

Adaptive Margin RLHF via Preference over Preferences Direct Preference Optimization: Your Language Model is Secretly a Reward Model

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.762269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.762269Z digest=sha256:6180ad3b0b7fadf34913c355d50f5edccf58ca2044ea1e75d525010790bd22b1

Observation 7e076658-0a5c-4316-a66f-74e70d1cae92 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:21.915511Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:21.915511Z digest=sha256:6ad705fe592d97d1c8f171628562407b3e3d84a108f5b7588748dced0aad22a7

Observation 03cac645-6536-4014-9036-d4ab7967df3a · outbound

This paper cites Shalev-Shwartz and S.

Adaptive Margin RLHF via Preference over Preferences Shalev-Shwartz and S

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.048055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.048055Z digest=sha256:9617f66ce25c61d5ebc145286be3124d11ed77d145f175ec707c8b11ce421fd2

Observation b2c2bc61-a198-446a-9200-9fa6941cfa6a · outbound

This paper cites Learning to summarize from human feedback.

Adaptive Margin RLHF via Preference over Preferences Learning to summarize from human feedback

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.241257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.241257Z digest=sha256:5577d017469a329c8b7fd02878ca76d4901ccb518fd03f2b81df80afc5561d50

Observation 35854391-623f-4756-b624-e2e1b12ea2ed · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.403138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.403138Z digest=sha256:13a5db5aaf60573189c7bf05539650e7cc823e6376b0f102ff0e799237d80f91

Observation 62422090-11c8-440a-9b8b-5b9b17d101ae · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Adaptive Margin RLHF via Preference over Preferences Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.474124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.474124Z digest=sha256:d7aacc0373a53c612cd26438a35c319111fe0c3a3a19e07e236c722c3e0a41e3

Observation ad48c468-41f6-4d02-b234-1c325540d4b9 · outbound

This paper cites Using Natural Language Explanations to Rescale Human Judgments.

Adaptive Margin RLHF via Preference over Preferences Using Natural Language Explanations to Rescale Human Judgments

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.663086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.663086Z digest=sha256:d694ca058725e68f1570b4e3daf08114ba73ca06acbf48a22825d638e862de79

Observation 6e2155e5-e488-4033-a71f-79949deb1a4c · outbound

This paper cites Secrets of RLHF in Large Language Models Part II: Reward Modeling.

Adaptive Margin RLHF via Preference over Preferences Secrets of RLHF in Large Language Models Part II: Reward Modeling

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.806003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.806003Z digest=sha256:c3740e88b3776b679d6e31d7805430fae06ae9c443631db09dd2545c4a4af067

Observation 930e524d-670e-4629-90cb-11db64921b0a · outbound

This paper cites Reward Difference Optimization For Sample Reweighting In Offline RLHF.

Adaptive Margin RLHF via Preference over Preferences Reward Difference Optimization For Sample Reweighting In Offline RLHF

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:22.977912Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:22.977912Z digest=sha256:ff219e54093474493621b136080a9d77b673bf99d5015e2d94aaf9de84f01a11

Observation a8ebfb0e-6e6d-484e-99f7-8832427597a9 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.152384Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.152384Z digest=sha256:cc7d3fce3f453d305ca1fea42ce96396d733ca4586cb2a086459ac62c7aa97be

Observation b4039719-d289-4f68-abe4-e1b8e027db86 · outbound

This paper cites HelpSteer2-Preference: Complementing Ratings with Preferences.

Adaptive Margin RLHF via Preference over Preferences HelpSteer2-Preference: Complementing Ratings with Preferences

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.416543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.416543Z digest=sha256:6f9fe1daa0fbd41ed85e48be8f6e78375202ea9453ca1ff2f00d18b3d714cc3f

Observation 9402494a-17ff-40a8-a70f-fee6e656ded9 · outbound

This paper cites AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization.

Adaptive Margin RLHF via Preference over Preferences AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.506011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.506011Z digest=sha256:624268afd3fd181f2681c9dd5654b5c0a4d28dc4c6094a22cbf556be6f6429bb

Observation 34d1da5e-9660-4de1-8f71-242207ba596a · outbound

This paper cites $\beta$-DPO: Direct Preference Optimization with Dynamic $\beta$.

Adaptive Margin RLHF via Preference over Preferences $\beta$-DPO: Direct Preference Optimization with Dynamic $\beta$

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.688099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.688099Z digest=sha256:80d0ae8475631956a56f4f52b1a1a9c7e67aeae7125dab46d7c1857a0e8cc92a

Observation a7872236-7bbf-40f2-a2a6-75a9f0eeba6e · outbound

This paper cites Zhang, R.

Adaptive Margin RLHF via Preference over Preferences Zhang, R

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.753724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.753724Z digest=sha256:4b8ec509c6d5927ebb182a135f8e9492fdf0b2fa78e035d31f6980820dc8d36d

Observation dca28929-3147-44b8-80dc-00812939bbea · outbound

This paper cites SLiC-HF: Sequence Likelihood Calibration with Human Feedback.

Adaptive Margin RLHF via Preference over Preferences SLiC-HF: Sequence Likelihood Calibration with Human Feedback

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.843777Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.843777Z digest=sha256:5fe4e04432a9f85a140df1ed661adeda4eb5cca331f1915144ee785b3043dc43

Observation 4195abd2-6dd2-466c-9378-df0b02df4e4e · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 42

Resolution
malformed identifier
no resolver link, observed 2026-08-04T14:52:23.913195Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.913195Z digest=sha256:29207c128913e94365da25fe08e559d918d6a401713decd1768dd304d7f33cc7

Observation 33823365-27bd-4322-a321-50012d02e943 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.005140Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.005140Z digest=sha256:df3c91d74016090553376dda0f07db0e2107a5190c2cafddd0d97c2db60d2704

Observation ba6ec33e-dac8-4464-aa14-a986278fc4ac · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.136944Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.136944Z digest=sha256:4a8281dffff6d1652b7073df719835b5e6af2cab14e44ff2d2956eec2ea89083

Observation ae76b861-3e3a-4385-bd13-6c4d87631726 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.264276Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.264276Z digest=sha256:c35837006cc500a302981f375bf2d2b211e0418becf81d15dc06b551e1c6eea6

Observation b183f1b7-2860-4c41-9765-ed3591a2c7a1 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.415800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.415800Z digest=sha256:4fc38b905286998855e914101a5644e14525461c8b902940680ed6e7fe8a7dff

Observation becc15a5-a966-456d-8d73-6f5e5ae7094f · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.575574Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.575574Z digest=sha256:08a3e3c87bd6ad17d6faf87fe3cb2c542a482343d4c362e137ee71eff14a6110

Observation 18a40dff-31c5-4a95-99fd-589c4fa50ef3 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.676764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.676764Z digest=sha256:13de49e9ce3fdc13239cb7cb95e4fb9a2229c4a1ec09e462189b405403baa6ce

Observation df5b5ed2-91a0-4b42-8d8f-32f52c2bc217 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:24.819696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.819696Z digest=sha256:9d2814bcdbcde084a12bb08b461d1941d422f405ddba9a0f6717165fb888ca8f

Observation 46703fff-72b9-4720-a0e6-e0bbc6f9801b · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 50

Resolution
malformed identifier
no resolver link, observed 2026-08-04T14:52:24.935392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:24.935392Z digest=sha256:3ce71adef9aad5c454d7b43beb4c74c1ae2e7a6fdc509b6da40447ea9055b136

Observation 19396117-59ba-4b42-89df-68333583a515 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.028667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.028667Z digest=sha256:c54f4b29fe41d7f056d1830277d285c3f33db32527e832a40b33d01c898667dd

Observation 6c25a5f6-86cc-4ca9-958b-055af1d78953 · outbound

This paper cites Trailer Park.

Adaptive Margin RLHF via Preference over Preferences Trailer Park

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.184988Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.184988Z digest=sha256:c235f0746be9b872af03450134164cb31e4399105dc82f9e76d5f035da6aa3c0

Observation 0eacef87-9bdd-47b8-be7e-b47458e2265c · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.276801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.276801Z digest=sha256:aab16dedffcd54d220314a7cd02a253b0d0d904ec366fd083fba4cc6a64b723a

Observation 4f33b784-df1c-4897-9197-736c156c6e89 · outbound

This paper cites It comes in various toppings including classic pepperoni but also more unique options such as cathead (a combination of prosciutto and arugula).

Adaptive Margin RLHF via Preference over Preferences It comes in various toppings including classic pepperoni but also more unique options such as cathead (a combination of prosciutto and arugula)

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.390652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.390652Z digest=sha256:8d332e3847c55582eb5a7ecff5359ab98b5242f2753716a682ce9f81620e0ed1

Observation 7d7a2a36-3ae1-4e81-a092-4ef92aa583cb · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.463887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.463887Z digest=sha256:23fd68a8934aa70cb08281cd476418aae238d43d519dbfeed081a6e02fdc6bff

Observation f0047949-78bb-42c4-bc94-29c180a70d5a · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.585139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.585139Z digest=sha256:663963e78003fa0dccfef5bf0cf7828bee124de0b659a81dc78b51f1cfcb55ea

Observation dd6a007a-d963-4e73-a11e-2c5528730d26 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.732076Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.732076Z digest=sha256:416aab0788e31cb275be9e47b592c9b715d512a322aff138868f319897ad759f

Observation bd327419-9064-4441-8af6-cc07ab337fd8 · outbound

This paper cites These are just a taste of what Austin has to offer when it comes to street food culture.

Adaptive Margin RLHF via Preference over Preferences These are just a taste of what Austin has to offer when it comes to street food culture

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.833263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.833263Z digest=sha256:42650c38123ba36f5335a884f674c0eddda16311f0cde650871c5474e66379c6

Observation 43a863ae-88c2-437f-a5b5-9639a4e27c6a · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:25.929612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:25.929612Z digest=sha256:e249980f512de2952e1b4d4ee650f68e88c5ab3c891a44bc2f8b193cf10978a0

Observation 1b523c27-65b4-49c9-aa95-71dd2e7c5d37 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.034237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.034237Z digest=sha256:91bfb84d336bd79e37919d2023543ed67a19fb3132a8a4ea09cedf57fc4bab46

Observation 80c953cb-459c-4c94-bb2d-d88893718526 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.120585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.120585Z digest=sha256:c85fef54c676f160fc52643f80001286c819d866734976ce02db828703095829

Observation 80241729-884a-4899-a568-d88f50667a00 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.249371Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.249371Z digest=sha256:e80bb4bd21e1e754e91e29d30ac510ad52451ce08fd106577afa83a5eeb39ceb

Observation 42c6f05d-10b4-494e-83b3-bee6ed28f842 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.362875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.362875Z digest=sha256:b26f7f641b11e96e783cfb8ce864c10ae3476ce1f07bb70b866d7e57dda7794f

Observation 28510f25-63f7-410c-94b6-ecd3adb4bb55 · outbound

This paper cites Big As Yo´Face.

Adaptive Margin RLHF via Preference over Preferences Big As Yo´Face

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.511683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.511683Z digest=sha256:3e9482cffa009db2b02ae5fa78590ce84ebaa8df91b6940c4fca0d8ce8c08990

Observation 62559684-b2ae-41ab-aea6-8b968a5a706c · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.714613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.714613Z digest=sha256:71a78409ce11b4db7c602712d547c81108ab6bad3d546b1cb44220e63216f389

Observation 600040fb-d03d-4019-8689-363ce8530dba · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:26.922954Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:26.922954Z digest=sha256:8f63dd67f5ab419e09c8d8ba8ca1c62a22822c96a8fa4e5deb4782e7b1877e86

Observation cb8e8394-cc1c-4420-8ac0-4f9e068db294 · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:27.059039Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:27.059039Z digest=sha256:55fed96d5e6c235a3381d31689c4cb7d44baaacaf926f057708f3459854ef87d

Observation a5b037e6-d769-4eca-9431-eee23b86fe8c · outbound

This paper cites an unresolved cited work.

Adaptive Margin RLHF via Preference over Preferences Unresolved cited work

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:27.204351Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:27.204351Z digest=sha256:cd0aa7a718811a3017d7a195d98359cfc564fc0b44ab40b1de8d480481e86fc4

Observation 7fb140ae-8efa-435e-8c29-f93029f42f82 · outbound

This paper cites Lion Burgers,.

Adaptive Margin RLHF via Preference over Preferences Lion Burgers,

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:27.322147Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:27.322147Z digest=sha256:f494cb42447fbe3eb87c450988accd428eab8db6c16ea4b0dffb210c4b98e0fb

Observation cc987b26-76a4-4d61-82ee-429d539bd995 · outbound

This paper cites HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM.

Adaptive Margin RLHF via Preference over Preferences HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-04T14:52:23.326087Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T14:52:23.326087Z digest=sha256:0f647eb5c2f52bd49759a5b4b0fa0327d506391c0d4d812fe213b804b9f2f3eb

Pith citing papers

No inbound Pith citation observations are available.