Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T15:15:46.465735Z
Paper Citation Record · LEDGER
As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2505.17122.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-07T15:15:46.465735Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
59 of 59 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation dba8227b-b72d-479f-bde8-1c13692362b6 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Aligning Large Language Models with Human: A Survey
Reference 1
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7d2ed43c-03db-40a8-bb27-85e3106ca46d · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs
Reference 2
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8cd1976d-7b7e-4604-8e5c-92cb51178a8f · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? UltraFeedback: Boosting Language Models with Scaled AI Feedback
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d28a6798-21be-4253-ae69-eba4f9d6140c · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? A General Language Assistant as a Laboratory for Alignment
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 88d0f485-409f-4db0-9ac5-9536f135504c · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cf6db343-9acf-4e71-8fe9-75b41c3e3b86 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Unresolved cited work
Reference 6
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 90b915a2-73f1-4b6a-b678-03d3275cabb1 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Manning, Stefano Ermon, and Chelsea Finn
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation bdd6cb4c-e052-4261-b266-da5ac02872ac · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? From Lists to Emojis: How Format Bias Affects Model Alignment
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 78f9a988-9b9a-4100-9941-4c68a102176d · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Offsetbias: Leveraging debiased data for tuning evaluators
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 0c05f996-aa3d-40b2-97b6-ba0cb90335e9 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Disentangling length from quality in direct preference optimization
Reference 10
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation aaa623f8-5777-4bc0-9e76-25b3c7eaf379 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? KTO: Model Alignment as Prospect Theoretic Optimization
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 14be7723-3d69-4534-914b-b17772787e2b · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? RewardBench: Evaluating Reward Models for Language Modeling
Reference 12
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 36fbaf91-6663-49fb-bc1a-4bf3cc467387 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Predictive pipelined decoding: A compute-latency trade-off for exact LLM decoding
Reference 13
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 80188a3d-4398-4158-af0d-294f3c38082b · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 3b8f2045-d632-41d8-8738-8ebcedfca088 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? SAM Decoding: Speculative Decoding via Suffix Automaton
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 42994f2b-78f4-42ef-a002-ba94498ea71e · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? S2D: Sorted Speculative Decoding For More Efficient Deployment of Nested Large Language Models
Reference 16
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 29734963-f7b4-4944-8d9e-0e41c3a07c99 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? The unlocking spell on base llms: Rethinking alignment via in-context learning
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 70a963a9-1809-427e-9e7d-f6048fc901e8 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Safety Alignment Should Be Made More Than Just a Few Tokens Deep
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b5578633-572c-42b3-8172-d6d7d4b49a57 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Christiano, Jan Leike, Tom B
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 57406553-5096-4b3f-8ebd-d538567bbf03 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? GPT-4o System Card
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8e0cc3c2-ba1f-4e04-b503-9cce0e585656 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Gemini: A Family of Highly Capable Multimodal Models
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 51ed382d-c3ad-4485-a917-b07d40cdee5e · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? The Llama 3 Herd of Models
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation be6848b4-31e8-4f5b-8cb2-4ba3225c8f7c · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? On the weaknesses of reinforcement learning for neural machine translation
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation dc0ec6a0-0fe7-4e1f-8560-d83ff9f57534 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Implementation Matters in Deep Policy Gradients: A Case Study on PPO and TRPO
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation f2cf9eaa-5d02-454e-91db-cc41a6877c14 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? SLiC-HF: Sequence Likelihood Calibration with Human Feedback
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c0afdf0d-fc39-4f31-92dc-09b17d5d8606 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? A general theoretical paradigm to understand learning from human preferences
Reference 26
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 0fa5c61f-94c3-481a-8301-bcdcf867e642 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Generalized preference optimization: A unified approach to offline alignment
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation cbfe94fd-9683-4d9b-802f-3a45d98322da · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? TreeBoN: Enhancing Inference-Time Alignment with Speculative Tree-Search and Best-of-N Sampling
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 096646df-cbfe-410b-b49b-a168e2289500 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? MaxMin-RLHF: Alignment with Diverse Human Preferences
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5adc1e2e-aa18-4435-b8a5-63735f194c7e · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Unresolved cited work
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a4303cc5-e39a-460a-9445-18eeca19d7b1 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Enabling Language Models to Implicitly Learn Self-Improvement
Reference 31
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation e723c431-617a-4fe5-b356-22ad22a55e18 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Mankowitz, Doina Precup, and Bilal Piot
Reference 32
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 9c33439b-9166-4d30-a133-cedb8c35ee48 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? A minimaximalist approach to reinforcement learning from human feedback
Reference 33
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 4a78435b-0abb-422c-95b9-2722526d7a4a · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Online Iterative Reinforcement Learning from Human Feedback with General Preference Model
Reference 34
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5b1df7d4-fdc7-47fe-b973-4912033fa0a3 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Llm-blender: Ensembling large language models with pairwise ranking and generative fusion
Reference 35
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation a75a1773-5596-48cf-9023-c22a84bf438f · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Liu, and Jialu Liu
Reference 36
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation f9c63e0b-c0fc-4171-ac2c-44ef9c55fbb5 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Llama 2: Open Foundation and Fine-Tuned Chat Models
Reference 38
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8f425f02-a243-48fb-a7ec-28fd60e427b8 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Helpsteer: Multi-attribute helpfulness dataset for steerlm
Reference 39
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 3b914cc7-38cc-4cf4-b2d8-134cc42f01bd · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Interpretable preferences via multi- objective reward modeling and mixture-of-experts
Reference 40
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 213384ad-82ee-49b3-a8c8-1caa91b66d9e · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct
Reference 41
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 28d70d3c-5a72-4fb9-9e3d-950c56eeb9cc · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Let’s verify step by step
Reference 42
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9e0e3dc3-97e1-4e1e-b2b4-f66c1636120f · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Process Reward Model with Q-Value Rankings
Reference 43
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fd190bca-f36f-4e72-8ff7-572712098a4d · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Glore: When, where, and how to improve LLM reasoning via global and local refinements
Reference 44
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 03ae14d6-fb94-4686-9f1a-5dde4f332355 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Defining and Characterizing Reward Hacking
Reference 45
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5d438329-22eb-47fd-abbe-59d554aa8208 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Arjona-Medina, Michael Gillhofer, Michael Widrich, Thomas Unterthiner, Johannes Brandstetter, and Sepp Hochreiter
Reference 46
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 8590a2c0-5e40-4575-bbc1-f14ab7ba74da · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? The effects of reward misspecification: Mapping and mitigating misaligned models
Reference 47
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 54f46a91-c27d-4127-9d08-f25b3ce50ebb · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Ball, Oleh Rybkin, Stephen Roberts, Tim Rocktäschel, and Edward Grefenstette
Reference 48
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 406f1a71-0f7a-4a3b-89d3-d2544b369b2a · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Correlated proxies: A new definition and improved mitigation for reward hacking, 2024
Reference 49
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cea58e23-3821-423b-96db-e25b04135b23 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Inform: Mitigating reward hacking in RLHF via information-theoretic reward modeling
Reference 50
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 80e08e02-5c8f-49fd-9790-1f82d1c7f942 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? When Can Proxies Improve the Sample Complexity of Preference Learning?
Reference 51
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation d803e9ca-2919-40ff-b1af-1d9199def227 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? RLHF Workflow: From Reward Modeling to Online RLHF
Reference 52
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation be2fa502-7c37-4c8e-8f45-2e9ed6e3baf4 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Unresolved cited work
Reference 53
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 4e11cece-30f0-48d4-9926-ead2d5b0d7e2 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Patterson, Joseph Gonzalez, Urs Hölzle, Quoc V
Reference 54
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 17ab31b6-f920-40fa-8e10-4b4deff297ea · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework
Reference 55
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dc602100-b4fc-47c2-9193-c4e43c8c19b9 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint, 2024
Reference 56
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 75172685-d121-4f34-a808-f78df1158f0f · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Hashimoto
Reference 57
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b6032cc0-7331-424c-9e6d-7ad104a6d1c8 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Hashimoto
Reference 58
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d1aa69f0-b56e-4868-ab57-addb7a5ebd00 · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Understanding dataset difficulty with V-usable information
Reference 59
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.
Observation 0f4afe28-e1cd-4cad-a579-c1e49c088abb · outbound
Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data? Unresolved cited work
Reference 2024
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
No inbound Pith citation observations are available.