Pith. sign in

Paper Citation Record · LEDGER

Reinforcement Learning from User Feedback

As of 8 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 4 inbound Pith citation observations for arXiv:2505.14946.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.14946 v1

Coverage vector

measured 15 of 15 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:31:19.984724Z

measured 19 of 19 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-03T04:00:17.717041Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-22T06:41:10.730142Z

Reference resolution

15 of 15 outbound references displayed

  • verified exact0
  • verified fuzzy3
  • unresolved12
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b2ab7095-50fb-416c-87bc-9a347c2cacdb · outbound

This paper cites write newline.

Reinforcement Learning from User Feedback write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:18.136449Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:18.136449Z digest=sha256:e92107b898bf2f81cc781b8231a81d86f24f6a2b2f09ebc2ec13c9ecc9a72fb4

Observation 8f263c6e-0cde-4bb6-b96b-90849af888b9 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Reinforcement Learning from User Feedback Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:18.262530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:18.262530Z digest=sha256:414b546fc2fc75e31bf418717110f2f06a42c5b36f06679a7d79e37f8e55b10e

Observation 523153a0-7109-4a28-bf9b-bc5488b3d8cd · outbound

This paper cites Deep neural networks for youtube recommendations.

Reinforcement Learning from User Feedback Deep neural networks for youtube recommendations

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:31:20.868378Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:31:18.404379Z digest=sha256:32b9ecaef27ebe6f9c6ea164302c00e680b27a4934720fee8d9b6500c6e29460

Observation 7052395b-27cb-4d97-a0d3-ede20d28d8d6 · outbound

This paper cites Safe RLHF: Safe Reinforcement Learning from Human Feedback.

Reinforcement Learning from User Feedback Safe RLHF: Safe Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:18.545522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:18.545522Z digest=sha256:a0aa9fa1f995a86227428295dc1dc3df46c8d68d0baa6968bfe8727dbb3f3593

Observation 5bf7fe79-51d5-464a-9e17-d20e2c49382d · outbound

This paper cites The Llama 3 Herd of Models.

Reinforcement Learning from User Feedback The Llama 3 Herd of Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:18.652719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:18.652719Z digest=sha256:3fd4c7892ffb540def147d07c77a1d6c1cfcd4019123d1a2578adcbd991f3e16

Observation 12575196-fd6d-46f4-a34b-dc1f0bcf13dd · outbound

This paper cites Monolith: Real Time Recommendation System With Collisionless Embedding Table.

Reinforcement Learning from User Feedback Monolith: Real Time Recommendation System With Collisionless Embedding Table

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:18.796406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:18.796406Z digest=sha256:738cb092dc693e073e8450134265e316e31523a56b44046cff252cb9287a6f21

Observation afc134b4-159d-400c-b6bf-a9a9957d135b · outbound

This paper cites Deep learning recommendation model for personalization and recommendation systems.

Reinforcement Learning from User Feedback Deep learning recommendation model for personalization and recommendation systems

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:31:20.630150Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:31:18.982092Z digest=sha256:b89bc2d8ee9ac5486f74af5f53fde4b5d3bfbbd20ce4595f34f22dd8fbe8e4b3

Observation e0e223e9-45df-4c5b-87da-8dccd58dd865 · outbound

This paper cites GPT-4 Technical Report.

Reinforcement Learning from User Feedback GPT-4 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:19.088890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:19.088890Z digest=sha256:39a139e12aeb33c829a7198aa15412bcab0811c6869f4072865beb36786eb3ad

Observation 187829dc-d5e9-4be6-8728-8a5decf356e1 · outbound

This paper cites Training language models to follow instructions with human feedback.

Reinforcement Learning from User Feedback Training language models to follow instructions with human feedback

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:19.258698Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:19.258698Z digest=sha256:c384b2ca0e53d897230f221cceee3ff462b290c42c32dc3394bda7bc9a08fb52

Observation 14511249-4d0a-4732-a8e2-58380b960387 · outbound

This paper cites Juicer: A benchmark for open domain dialogue evaluation with diverse negative responses.

Reinforcement Learning from User Feedback Juicer: A benchmark for open domain dialogue evaluation with diverse negative responses

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:31:20.378457Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=arxiv_source observed=2026-08-07T15:31:19.387326Z digest=sha256:474ee64183f7e61b72686a46d6275ca2284a35044e5e720482ef6cb66e02f0e8

Observation 832ffd17-9217-4ad5-9f8d-1669bfd06395 · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Reinforcement Learning from User Feedback Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:19.528623Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:19.528623Z digest=sha256:f3ed61440142feb1660607cc7e44505b4b7469258a96d0f0a5b61ec3b77ce82f

Observation fd73abf3-90d8-4f4c-a164-675c57203be7 · outbound

This paper cites Improving Open Language Models by Learning from Organic Interactions.

Reinforcement Learning from User Feedback Improving Open Language Models by Learning from Organic Interactions

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:19.651643Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:19.651643Z digest=sha256:10023d7f303802920b61dbe0853bc42ba086e0916179aafd7c1dab8cc18d1764

Observation 75b57ebb-2c3e-4acd-9fe1-0523b5f07d79 · outbound

This paper cites The Perfect Blend: Redefining RLHF with Mixture of Judges.

Reinforcement Learning from User Feedback The Perfect Blend: Redefining RLHF with Mixture of Judges

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:19.744551Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:19.744551Z digest=sha256:215762f0bc7f138a8cf839aee19365ef705367a84bd0f17632bc9653c3763a28

Observation 6e8cb7dd-c969-43e7-b52d-91bbe4171d6c · outbound

This paper cites Secrets of RLHF in Large Language Models Part I: PPO.

Reinforcement Learning from User Feedback Secrets of RLHF in Large Language Models Part I: PPO

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:19.864968Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:19.864968Z digest=sha256:4488bba374ad3340f5e620b5e09cfb95bb118dd5219c6db21d5b837a1ecef9c7

Observation ba52866a-1355-43be-aa47-161221142ae4 · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Reinforcement Learning from User Feedback Fine-Tuning Language Models from Human Preferences

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:31:19.984724Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T15:31:19.984724Z digest=sha256:98a624fe2796f9e41a3387afad625e3120e21dab5867aa67ee5d02b649fa1770

Pith citing papers

Observation d87a5206-3a8d-43b2-883a-5aa84860bd56 · inbound

Improve Large Language Model Systems with User Logs cites this paper.

Improve Large Language Model Systems with User Logs Reinforcement Learning from User Feedback

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-21T14:34:12.887504Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-21T14:34:01.332088Z digest=sha256:038bae21dc1169c1d7627110662ea2c18d6790e9d44b1d44e0da2a222968abc8

Observation cc288a59-2e67-4c42-8f07-1a56c70ae9e6 · inbound

Improve Large Language Model Systems with User Logs cites this paper.

Improve Large Language Model Systems with User Logs Reinforcement Learning from User Feedback

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T04:00:17.717041Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T04:00:17.717041Z digest=sha256:a5fe231c9521c8d2a6dda57e1d52b35d560259c48f42e5a88954e32123c03e99

Observation 53b82c74-fda3-4e75-b667-04a7ee5080d5 · inbound

Don't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target cites this paper.

Don't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target Reinforcement Learning from User Feedback

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-20T14:18:21.443053Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-20T14:13:49.666793Z digest=sha256:39be6f72129abcf88c988368c76970fb4f6574fc8967a732c0e8eddcbf2fb83b

Observation be025eea-7c21-41ee-bd3e-2b19cfe6c51b · inbound

Echo: Learning from Experience Data via User-Driven Refinement cites this paper.

Echo: Learning from Experience Data via User-Driven Refinement Reinforcement Learning from User Feedback

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-22T06:41:10.732700Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-05-22T06:37:34.840129Z digest=sha256:be449ccbf2caf5c5d02f2ee1f28e8cd1096671f04bd748224fb946973ccadb2c