Pith. sign in

Paper Citation Record · LEDGER

WorldPM: Scaling Human Preference Modeling

As of 19 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 10 inbound Pith citation observations for arXiv:2505.10527.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.10527 v2

Coverage vector

measured 54 of 54 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T21:12:52.810257Z

measured 64 of 64 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 10 of 10 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-15T19:25:22.019686Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T00:07:27.940098Z

Reference resolution

54 of 54 outbound references displayed

  • verified exact0
  • verified fuzzy7
  • unresolved47
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation dd4945dd-82cb-492c-9114-082e1378e27d · outbound

This paper cites A General Language Assistant as a Laboratory for Alignment.

WorldPM: Scaling Human Preference Modeling A General Language Assistant as a Laboratory for Alignment

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.478426Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.478426Z digest=sha256:241336556fb043701aca5f11232f3a919bad8291e9ae8ba8bd9823d1c6e086c5

Observation 7fe14baf-8470-46ee-82a7-111fb8396b34 · outbound

This paper cites Program Synthesis with Large Language Models.

WorldPM: Scaling Human Preference Modeling Program Synthesis with Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.485232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.485232Z digest=sha256:ef15caf549572e07f9b410287d2c7a68e6f91c9dd188a80eeaeeba5510dbeac0

Observation 038d8ad6-2151-455d-86af-2d48750a302f · outbound

This paper cites Qwen Technical Report.

WorldPM: Scaling Human Preference Modeling Qwen Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.491148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.491148Z digest=sha256:aca4bd11392749397304dc0a7a0372c5d96f81f85089c4af000973c8ed04aaed

Observation 78d59d92-fe07-4506-a9a3-316ac83f7753 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

WorldPM: Scaling Human Preference Modeling Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.497498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.497498Z digest=sha256:d3b652b7980ee65c15d3d424432ec9b7247cbd70ac679bf80412e41af51eee9a

Observation e4ab421e-f427-409a-b4c2-39ffd8ef1452 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

WorldPM: Scaling Human Preference Modeling Constitutional AI: Harmlessness from AI Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.503000Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.503000Z digest=sha256:c88caf955cba29ce083ffa2adceeec200aeabe27ae673bab348683e1cd5d87c0

Observation d18cef2f-043a-4af2-aeb4-2142cd93b39f · outbound

This paper cites an unresolved cited work.

WorldPM: Scaling Human Preference Modeling Unresolved cited work

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.508807Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.508807Z digest=sha256:56d2fe5dbbd03db2758fe6c8e8eef11746dcce432506147c0c1db5aaf315391e

Observation c15523b1-4a19-4dcf-a6f0-b574cf8f1a8c · outbound

This paper cites Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference.

WorldPM: Scaling Human Preference Modeling Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.518084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.518084Z digest=sha256:315985bf5d61b33abd4da5b5c466baa5d1d97eb728310c70e4758956b0f691e9

Observation 8b407869-0a74-468d-ad8a-03bf4a5f4c32 · outbound

This paper cites Deep reinforcement learning from human preferences.

WorldPM: Scaling Human Preference Modeling Deep reinforcement learning from human preferences

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.527786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.527786Z digest=sha256:7c86cf40376204c2419f7492807d9c9249dea99930010380bfeef2abfbed47b2

Observation a2cca691-02e8-4761-a1bc-2e5f04746e33 · outbound

This paper cites Reward Model Ensembles Help Mitigate Overoptimization.

WorldPM: Scaling Human Preference Modeling Reward Model Ensembles Help Mitigate Overoptimization

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.537302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.537302Z digest=sha256:f26ec52ad9511f53c767ef28e89edf1166a1fb64e1d772f5a8cda4db6b77d45c

Observation 2c8dfd03-b2c8-42ba-9770-a3af028f6b7f · outbound

This paper cites Cram \'e r.

WorldPM: Scaling Human Preference Modeling Cram \'e r

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:12:53.994356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T21:12:52.542032Z digest=sha256:53a3ad5acbb703f495af15cefb534007b9bd39d8b34a570e74b9367ecf5605be

Observation 9e2dc8e8-9bd6-42ee-b1f0-a45a48687731 · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

WorldPM: Scaling Human Preference Modeling UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.554517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.554517Z digest=sha256:30d1cc7edbdbff6c413c01b382041d0151872275a0292b9103fb6a4daa069eaf

Observation 25581d1d-a1c4-44d6-bdf1-a56e93872eb4 · outbound

This paper cites The Llama 3 Herd of Models.

WorldPM: Scaling Human Preference Modeling The Llama 3 Herd of Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.559605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.559605Z digest=sha256:1a8361bd7ab9e8df9aad1ec78f7318092e2e76e7f8848390e72ec7907cc01652

Observation f5c2e0d6-c2b0-4cdd-81e0-35e196432e1a · outbound

This paper cites Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators.

WorldPM: Scaling Human Preference Modeling Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.565755Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.565755Z digest=sha256:3bcd5ac5451945ac3c14d88fff5228bea8fc6413d1af6a7df35c571c77a8231f

Observation a9edae22-3c0b-46a6-8a2f-6bcc74c1bbb9 · outbound

This paper cites Networks, crowds, and markets: Reasoning about a highly connected world, volume 1.

WorldPM: Scaling Human Preference Modeling Networks, crowds, and markets: Reasoning about a highly connected world, volume 1

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:12:53.974825Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T21:12:52.570501Z digest=sha256:b18d871fcf407fb4946edbc55204aa944db99dfb0f5abf2ab6c4bc8a221a64f1

Observation a1e8dd68-4f2c-469a-9845-439d8b3b5b15 · outbound

This paper cites Style Outweighs Substance: Failure Modes of LLM Judges in Alignment Benchmarking.

WorldPM: Scaling Human Preference Modeling Style Outweighs Substance: Failure Modes of LLM Judges in Alignment Benchmarking

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.576766Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.576766Z digest=sha256:9fab1a8c6895cc14e9db8c9e8ef1aaeb1a568774369d6a169f46c6f0648f714d

Observation 56419043-d0e3-4983-ad43-cebbd94833a0 · outbound

This paper cites Athene-70b: Redefining the boundaries of post-training for open models, July 2024 a.

WorldPM: Scaling Human Preference Modeling Athene-70b: Redefining the boundaries of post-training for open models, July 2024 a

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.583615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.583615Z digest=sha256:26d49e30a253bc6ec2e0643bb7f43ea2d249f7309bc577fa1bef6c51e4207b8d

Observation 246eac89-1703-458f-8d1c-c5afa4793d67 · outbound

This paper cites How to Evaluate Reward Models for RLHF.

WorldPM: Scaling Human Preference Modeling How to Evaluate Reward Models for RLHF

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.589817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.589817Z digest=sha256:8d8de02ad78e986eb99c0beaebd288b972988a3c03e6d68fb03ee3062cff62a3

Observation 64056f1d-7309-43b0-bd39-97293d856249 · outbound

This paper cites Scaling laws for reward model overoptimization.

WorldPM: Scaling Human Preference Modeling Scaling laws for reward model overoptimization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.599159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.599159Z digest=sha256:a1464973cc2542808c6cdf678c2f948fd9cf5b1f341d8ca84608b569e1277c37

Observation a1a25115-ff8c-4727-84fa-310136e56e9e · outbound

This paper cites Zemel, Wieland Brendel, Matthias Bethge, and Felix Wichmann.

WorldPM: Scaling Human Preference Modeling Zemel, Wieland Brendel, Matthias Bethge, and Felix Wichmann

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:12:53.922923Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T21:12:52.608497Z digest=sha256:553bae4b6ee4c1817d3e108b6eb57ca4e3a8bc7c5a9d8e6b8b49cfac2f29d4e1

Observation 60c429d7-0e1b-476c-9833-a885d173e835 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

WorldPM: Scaling Human Preference Modeling Measuring Mathematical Problem Solving With the MATH Dataset

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.615710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.615710Z digest=sha256:d23d02c3b5af95bec7cb888bc9e2ce8e1ba09f7cf110c5a192344ee4ddd4f3f3

Observation c3d2ec17-2845-421d-8bef-be598663dc91 · outbound

This paper cites Surface Form Competition: Why the Highest Probability Answer Isn't Always Right.

WorldPM: Scaling Human Preference Modeling Surface Form Competition: Why the Highest Probability Answer Isn't Always Right

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.625178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.625178Z digest=sha256:ad4f467b7419f3ea16d6ac760c3d2d8f46a994c054c436262f0a945e631103a9

Observation e9b9f065-fc85-4afb-a579-b93c7823b9f4 · outbound

This paper cites Collaborative filtering for implicit feedback datasets.

WorldPM: Scaling Human Preference Modeling Collaborative filtering for implicit feedback datasets

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:12:53.894272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T21:12:52.631146Z digest=sha256:5405d192390deb6f696b5c651a7774342972ae544ee976352ea63792bcc84ac5

Observation 6caf8d8f-3628-4ef2-8257-9cd018587043 · outbound

This paper cites Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback.

WorldPM: Scaling Human Preference Modeling Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.638694Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.638694Z digest=sha256:996cb2d914dc217dbae2d1bec755992c404d620bdb20ca663075203902ea261b

Observation e2e0d544-b10c-42bb-8697-0bb6cdb470f1 · outbound

This paper cites Scaling Laws for Neural Language Models.

WorldPM: Scaling Human Preference Modeling Scaling Laws for Neural Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.645824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.645824Z digest=sha256:5016ef55190247a2c47a0a06f9795b15e9fe35b1f1db024cbb51602364c59e99

Observation 37859d0e-2136-4685-83c0-50360ea94db8 · outbound

This paper cites Smith, and Hannaneh Hajishirzi.

WorldPM: Scaling Human Preference Modeling Smith, and Hannaneh Hajishirzi

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.651832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.651832Z digest=sha256:e19a53f7ee4500f2cf68e8d444cc1574aa739e56fd017bc9a36e5ebed34e689e

Observation 1dc354db-4daf-4c07-b070-3bed702d1ab3 · outbound

This paper cites Rlaif vs.

WorldPM: Scaling Human Preference Modeling Rlaif vs

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:12:53.859118Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T21:12:52.656679Z digest=sha256:f578001872bee2a4b23ffcf1888f04918811f107af8c294b0657145a2e871967

Observation 00b5977d-921c-4773-ab1c-d00d38674d54 · outbound

This paper cites Gonzalez, and Ion Stoica.

WorldPM: Scaling Human Preference Modeling Gonzalez, and Ion Stoica

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.662907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.662907Z digest=sha256:c18201bda88aaa467f1a1dc42adf64410242a419f55c0976525dd8f499a45504

Observation 158002a8-73d6-4172-9fd1-c2b51571f46c · outbound

This paper cites ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models.

WorldPM: Scaling Human Preference Modeling ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.668743Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.668743Z digest=sha256:725a88148958b5630aa75fa2335c93fa333d3c003525fd76829bcea870379cf0

Observation 01faa9ca-2b6a-43f3-b60a-92979cf005ca · outbound

This paper cites RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style.

WorldPM: Scaling Human Preference Modeling RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.675541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.675541Z digest=sha256:58bb5dc2c319c223b5021ef77a9eb005471e8132c0ff94681381a3d652c60da3

Observation 9fd180ff-098e-42b7-a39c-3b787a326217 · outbound

This paper cites OctoPack: Instruction Tuning Code Large Language Models.

WorldPM: Scaling Human Preference Modeling OctoPack: Instruction Tuning Code Large Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.681472Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.681472Z digest=sha256:b49b6e490fd222233458fdd81baea57458d4a6b2b9336d3e75512ee3d5c68ab1

Observation 7d186b9f-d975-4f0a-8f43-6bebc313e223 · outbound

This paper cites Training language models to follow instructions with human feedback.

WorldPM: Scaling Human Preference Modeling Training language models to follow instructions with human feedback

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.688122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.688122Z digest=sha256:24a00a53d5991900cf97b4cb7fdfd00148bd91e33ba87c76a07e713238e70cee

Observation d62c5174-d338-49de-b53a-c6df2d7b9478 · outbound

This paper cites Maxwell Harper, and Joseph A.

WorldPM: Scaling Human Preference Modeling Maxwell Harper, and Joseph A

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:12:53.788178Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T21:12:52.694991Z digest=sha256:02c355271c0f0e5e10d77b049705fbc055ce49f02fcda8c8552cc28365162f62

Observation c0978775-496a-4fb0-932b-a78846273445 · outbound

This paper cites OffsetBias: Leveraging Debiased Data for Tuning Evaluators.

WorldPM: Scaling Human Preference Modeling OffsetBias: Leveraging Debiased Data for Tuning Evaluators

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.701060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.701060Z digest=sha256:b8d55842b31fd1cf1a3f85566c5e7725e2be888d5f24341a164a93ad771e8d25

Observation bb293d53-4df8-4b20-9de1-5c0af81d3f49 · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

WorldPM: Scaling Human Preference Modeling GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.705495Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.705495Z digest=sha256:5671ceb95052b638776805ccdf79f61ef282c12d1fc387f6e91e9c07fa66c3ce

Observation ad4e9b09-21d8-48c5-9413-65c7648b1373 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

WorldPM: Scaling Human Preference Modeling DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.712234Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.712234Z digest=sha256:13c61f0322653a19b5464c3fff048d3f84846ff78246caa300a5d30db41fbfc1

Observation 3e3d2f2f-2adb-418a-816b-b262f2d578a9 · outbound

This paper cites Learning to summarize with human feedback.

WorldPM: Scaling Human Preference Modeling Learning to summarize with human feedback

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.717933Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.717933Z digest=sha256:b6f8a8b110153a723c82262ab31e744f6455943d9862be0bcef8e0960bc5f59a

Observation 46458c3d-2c32-4ca9-b8fb-52607b01e985 · outbound

This paper cites Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives.

WorldPM: Scaling Human Preference Modeling Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.721989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.721989Z digest=sha256:f7ceda8cb1b999ce07ad2813220d6c4fb2d97558bef97bf3fc2815d7a15f9b9b

Observation 6a5b55ef-5e5e-4d10-8554-cb69fc0a421b · outbound

This paper cites Interpretable preferences via multi-objective reward modeling and mixture-of-experts.

WorldPM: Scaling Human Preference Modeling Interpretable preferences via multi-objective reward modeling and mixture-of-experts

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.727248Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.727248Z digest=sha256:36e5070abf1e082f8681352bcc394e639c9e92674e0c2510ba68864fbd5710ac

Observation 41abadb6-c16f-48de-b069-8cef397bfd3d · outbound

This paper cites MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark.

WorldPM: Scaling Human Preference Modeling MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.731295Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.731295Z digest=sha256:549903a7319806c066367e6c0c5de45c1dd0d82370c404c41286f5c3b1111989

Observation caed08d2-caed-4eec-b14c-a38746b092d5 · outbound

This paper cites HelpSteer2: Open-source dataset for training top-performing reward models.

WorldPM: Scaling Human Preference Modeling HelpSteer2: Open-source dataset for training top-performing reward models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.735907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.735907Z digest=sha256:7aa83ec75751829bca61dcec6ab99c8ab1bb840984d4d9e44f3f887b3e8841e4

Observation 0d4ad2b1-874d-4be8-a21c-f2565d598da1 · outbound

This paper cites Emergent Abilities of Large Language Models.

WorldPM: Scaling Human Preference Modeling Emergent Abilities of Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.741291Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.741291Z digest=sha256:204ee27a18f9dd0792d78c025408ee9116e747d1b4fa07bd5b41e3c0dd7a323e

Observation 01a55ba0-bc37-4935-808b-11092538745d · outbound

This paper cites Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study.

WorldPM: Scaling Human Preference Modeling Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.746392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.746392Z digest=sha256:4b8b7754c6728626608c279e090178e46963e56bb7f437ffb60c56c57ac6d3c5

Observation f256540d-e209-442c-9c08-be02850d0fe1 · outbound

This paper cites Qwen2 Technical Report.

WorldPM: Scaling Human Preference Modeling Qwen2 Technical Report

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.751105Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.751105Z digest=sha256:b250d64a6fbee4b9a3775f5f055aecdc7f4e2363f243c58c67045faa083fedd1

Observation ad59b7f5-6717-460b-8795-56c05bbad3ca · outbound

This paper cites Qwen2.5 Technical Report.

WorldPM: Scaling Human Preference Modeling Qwen2.5 Technical Report

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.755325Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.755325Z digest=sha256:a7e63aaeb6e3c31a9c7bd1add80f51085377030544e8589e7e11c9cf6db37b16

Observation 26e9dce5-c17c-4dce-b01d-3cb7d9ee180b · outbound

This paper cites Evaluating large language models at evaluating instruction following.

WorldPM: Scaling Human Preference Modeling Evaluating large language models at evaluating instruction following

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.759300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.759300Z digest=sha256:97c84b5ce25ba2a2fccc45583bf4bdbe01ab520cde7cec20cf7c0051cf60d07e

Observation 3094a929-2a9b-4494-ae38-dc2201a933f1 · outbound

This paper cites Understanding deep learning requires rethinking generalization.

WorldPM: Scaling Human Preference Modeling Understanding deep learning requires rethinking generalization

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.763514Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.763514Z digest=sha256:e46504ade3bae8230eb56c738ea88049c3b026a63fe36d081e2dce709472dc77

Observation 1ae01066-6b79-480c-b369-c48cf36c3d1e · outbound

This paper cites Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena.

WorldPM: Scaling Human Preference Modeling Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.769528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.769528Z digest=sha256:4f97d0bf4bd776847ea4cb63d2f9ec52828b3f4d4819c56c2a7d843ef6cce7c0

Observation 27dd7f08-22fb-434a-a112-2a496e1054c5 · outbound

This paper cites Secrets of RLHF in Large Language Models Part I: PPO.

WorldPM: Scaling Human Preference Modeling Secrets of RLHF in Large Language Models Part I: PPO

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.776891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.776891Z digest=sha256:0e4bc7f3b38f417ef269db0025db1325ba6e40fc2b8e9c9e04a9e4ec843fef77

Observation 475d6f77-da7c-453e-975c-47bc36c51078 · outbound

This paper cites RMB: Comprehensively Benchmarking Reward Models in LLM Alignment.

WorldPM: Scaling Human Preference Modeling RMB: Comprehensively Benchmarking Reward Models in LLM Alignment

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.781845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.781845Z digest=sha256:2fc98d8fdca4ee6f3e10e119babd3e7c225e0a0d706417e730a8ca5c935d5f13

Observation 234cd9c5-2b91-4154-b177-b17023842e3e · outbound

This paper cites Instruction-Following Evaluation for Large Language Models.

WorldPM: Scaling Human Preference Modeling Instruction-Following Evaluation for Large Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.789452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.789452Z digest=sha256:c091aa32e7586874ad4f518c362d2cb2b3466acb836c1911cf86940c0a9dd30f

Observation a8678d4c-cfa5-494a-bfed-fd0f8a36e948 · outbound

This paper cites write newline.

WorldPM: Scaling Human Preference Modeling write newline

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.794824Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.794824Z digest=sha256:188d9ae4d53295ef2bb1882639d5aa3b0b64881f1367bace0f1078f9a5f0e5a0

Observation 6b40fdb6-cf0b-46c9-bb56-43258e14e66d · outbound

This paper cites @esa (Ref.

WorldPM: Scaling Human Preference Modeling @esa (Ref

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.800078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.800078Z digest=sha256:2dc9f5e4f9351b6fa364a7d7a234eccb8ba5207e900e8a609be9c4d91dd06a93

Observation e0420f27-bb26-4d8c-8baa-85f4abc1d253 · outbound

This paper cites an unresolved cited work.

WorldPM: Scaling Human Preference Modeling Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-15T21:12:52.805530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T21:12:52.805530Z digest=sha256:fa7bf9712e54fe6956b9031d833c5af746d3a3f132dff5cccae53fbe2d83dfe5

Observation 187be880-bd1c-40ca-90cd-1d02e2f9bfb0 · outbound

This paper cites D sRGB DeXIfMM* i ͠ u @IDATx ]7 1ϳP<桔c iu0jP3.

WorldPM: Scaling Human Preference Modeling D sRGB DeXIfMM* i ͠ u @IDATx ]7 1ϳP<桔c iu0jP3

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T21:12:53.517275Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T21:12:52.810257Z digest=sha256:34016ef844e98f4b7e9113132573cc89e03ec008d346fcbb447374974b7b1305

Pith citing papers

Observation ffe7d007-f520-4ac2-ab6f-069bcd1cb401 · inbound

Arch-Router: Aligning LLM Routing with Human Preferences cites this paper.

Arch-Router: Aligning LLM Routing with Human Preferences WorldPM: Scaling Human Preference Modeling

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T19:25:22.019686Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:25:22.019686Z digest=sha256:6cbdaaced4b3750f5fedd48fed73a2c6e4c590d3018ee49d34478d29254d46f9

Observation c6887f61-aa82-4a10-9f0e-16a07b78309b · inbound

RewardDance: Reward Scaling in Visual Generation cites this paper.

RewardDance: Reward Scaling in Visual Generation WorldPM: Scaling Human Preference Modeling

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-04T20:09:00.504202Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T20:09:00.504202Z digest=sha256:424adee035efa8be36acd16726b60f22cd1c427a7b08cbed69554784407998fb

Observation f423c084-1aae-4047-82a9-ee19963d9dc0 · inbound

AI Can Learn Scientific Taste cites this paper.

AI Can Learn Scientific Taste WorldPM: Scaling Human Preference Modeling

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T18:14:49.961366Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T18:14:49.961366Z digest=sha256:93eaee52ab2cae0a3207b960eee06023bbd5645f6e8dd9f1e31cf33f84e34568

Observation c7f984f2-8052-45cb-abbe-747d8cfe1a63 · inbound

Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization cites this paper.

Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization WorldPM: Scaling Human Preference Modeling

Reference 9

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T06:51:46.328497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-05-10T06:47:34.623340Z digest=sha256:ab199ea3b28360e8124bcce210e59b0607b307ebfa90a24eec2d2236012f031d

Observation d8ebd339-9560-40c2-9808-0fb0e0b52c20 · inbound

Leveraging Verifier-Based Reinforcement Learning in Image Editing cites this paper.

Leveraging Verifier-Based Reinforcement Learning in Image Editing WorldPM: Scaling Human Preference Modeling

Reference 55

Resolution
verified exact
arxiv_id, observed 2026-05-12T10:06:27.446483Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-07T08:00:33.307429Z digest=sha256:a0b82f9b31d1e403d5d2381b022440721489e576fbca72f24301a27ba90541cf

Observation b54261bb-8481-4f67-9bc9-04a6944e3572 · inbound

Leveraging Verifier-Based Reinforcement Learning in Image Editing cites this paper.

Leveraging Verifier-Based Reinforcement Learning in Image Editing WorldPM: Scaling Human Preference Modeling

Reference 55

Resolution
verified exact
arxiv_id, observed 2026-05-21T09:14:05.932676Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-21T09:11:02.183133Z digest=sha256:628634bccf6e76515cf3e9e75c36d91cfe330302aa6d38f0f31f126b8f09d10c

Observation 2619ad0c-fc3c-45c9-8374-4ed6ab95b580 · inbound

RewardHarness: Self-Evolving Agentic Post-Training cites this paper.

RewardHarness: Self-Evolving Agentic Post-Training WorldPM: Scaling Human Preference Modeling

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-12T08:31:23.995255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-12T01:05:25.567581Z digest=sha256:772896949872444ac699c0230baa116d519bef079b7d9ffd33010f68a58789f1

Observation 7808e38c-29ba-4e74-a93b-4aad4a8ebd20 · inbound

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions cites this paper.

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions WorldPM: Scaling Human Preference Modeling

Reference 54

Resolution
verified exact
arxiv_id, observed 2026-07-03T00:07:27.941638Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-27T17:30:57.001021Z digest=sha256:aeb27fad80a06d3b91f8f8d195e770cba94cfc895c6f5fcebbd6df3caaa8e85c

Observation 2d25d118-c7e0-45f1-8ef5-4658c4a9af16 · inbound

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions cites this paper.

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions WorldPM: Scaling Human Preference Modeling

Reference 54

Resolution
unresolved
no resolver link, observed 2026-07-15T10:53:37.186361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-15T10:53:37.186361Z digest=sha256:75fddd075d42913eed707c0da3c27dba0edf4fe54abb3c1a3ee250d723b91671

Observation e834e349-dfe1-4c35-b6a7-699bc4d1b514 · inbound

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction cites this paper.

RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction WorldPM: Scaling Human Preference Modeling

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T05:49:45.723481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T05:49:45.723481Z digest=sha256:d3066bcdff5544b0dd5d7cf533eab95785426887812cc527af48009ea761563e