Pith. sign in

Paper Citation Record · LEDGER

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary

As of 21 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2507.07375.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.07375 v1

Coverage vector

measured 78 of 78 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T18:51:32.708316Z

measured 78 of 78 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

78 of 78 outbound references displayed

  • verified exact2
  • verified fuzzy29
  • unresolved47
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cd50d613-d633-4991-8971-8b128e83bfaf · outbound

This paper cites A survey on evaluation of large language models.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary A survey on evaluation of large language models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:26.817729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:26.817729Z digest=sha256:943e3317ea27257a55ced243d8bb45f2eeca13947f3f92be0b0a1e2ce0a4af26

Observation 7b4481ec-ba23-4c3d-b178-99c05edaff16 · outbound

This paper cites Using an llm to help with code understanding.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Using an llm to help with code understanding

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.883557Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:26.900211Z digest=sha256:2752d04fec8d9c99e5847bb9d47955d4d1ef91467c718a6ef22046c35e5e76ad

Observation 0001cbad-5f0e-480a-8c10-ab04577d1bc4 · outbound

This paper cites A Survey of Large Language Models.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary A Survey of Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:26.955072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:26.955072Z digest=sha256:86f54fc4067fb9748f901e62c538a0c751cdc28b637df3c13397a49d3e056589

Observation 30c80e4a-ccfe-41b7-ab00-f763bfd2ca55 · outbound

This paper cites A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:26.988505Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:26.988505Z digest=sha256:299a1d0597c0de038a5cd68a10e5dc38de53ed2e71f54ec82bb66ff83f65d198

Observation 25a11b13-7de4-405b-b82f-73cda5024c44 · outbound

This paper cites A Survey on Large Language Models for Code Generation.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary A Survey on Large Language Models for Code Generation

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.064082Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.064082Z digest=sha256:3317c8c2ee032a2472ac9493c83f05cbe59b5ae4d020b2bf956360e7eac2afcc

Observation 916dd231-eeeb-4be9-8b3f-46bbd95effa9 · outbound

This paper cites Nguyen, Quang Pham, and Nghi D.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Nguyen, Quang Pham, and Nghi D

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.871249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:27.130144Z digest=sha256:b27dba22e133b34faf96e71db0e9148ca2f0d89d64616a5f432869d995b0c0a0

Observation 5e740f70-b253-4026-90f8-c7df0600ac8c · outbound

This paper cites Rational decision-making agent with learning internal utility judgment.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Rational decision-making agent with learning internal utility judgment

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.859303Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:27.192885Z digest=sha256:0236155deed18cf9d5b010f22250c093fed5f1378c4c5f390f6a2b8e36c15e27

Observation 349be0f5-8bb4-44e0-a2ab-341f001069a5 · outbound

This paper cites How Far are LLMs from Real Search? A Comprehensive Study on Efficiency, Completeness, and Inherent Capabilities.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary How Far are LLMs from Real Search? A Comprehensive Study on Efficiency, Completeness, and Inherent Capabilities

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-06T18:51:33.411523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:27.287880Z digest=sha256:01d69099c661d54cb511b0516eb1d6037f43cbb044e98c34a45b37beee77e9c3

Observation 77e7bd53-557f-4cd7-973b-dded99fde893 · outbound

This paper cites Safe RLHF: Safe reinforcement learning from human feedback.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Safe RLHF: Safe reinforcement learning from human feedback

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.847033Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:27.397407Z digest=sha256:811f750208bd7719e5bd7ea2d4307d3630a1eb00764e43e07048b1f860585e9e

Observation 69708228-e735-41ca-9311-dc586d66fc1f · outbound

This paper cites Data-adaptive Safety Rules for Training Reward Models.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Data-adaptive Safety Rules for Training Reward Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.438057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.438057Z digest=sha256:189d7459feda9a6319ed99f7649f412dbaaed7da67388c4d69838445b7feaf58

Observation f7f6c85d-63e3-48c7-817c-802b866accaa · outbound

This paper cites Large Language Model Alignment: A Survey.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Large Language Model Alignment: A Survey

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.506062Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.506062Z digest=sha256:41097266e9a44a737d140409d8e7416ba07e588ce141e5ed65ce6988e5a05054

Observation 96ebcb40-f4e9-4f43-b29b-46b60683ab82 · outbound

This paper cites Catastrophic failure of LLM unlearning via quantization.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Catastrophic failure of LLM unlearning via quantization

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.832930Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:27.565861Z digest=sha256:0bf82678665201119f23b8aaf9ec71410f02885a2b0b09174d1c82b27a075c97

Observation 0ad21580-69cc-445f-aa0b-1c0e961d356a · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.611461Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.611461Z digest=sha256:2574f66134890d9ccd1fcffbf9911aee37d872387556b67a041e22ec9231db45

Observation bd1fea6c-175a-4353-82c2-3ac45f6e46bc · outbound

This paper cites Training language models to follow instructions with human feedback.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Training language models to follow instructions with human feedback

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.687717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.687717Z digest=sha256:f363fd5bed402092e3f2a2ca0792fe56ee44362b2fbe086e26e7680617b57443

Observation 3b7edfe9-52ea-4f00-8d2a-2cbe30e2a777 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Proximal Policy Optimization Algorithms

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.723709Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.723709Z digest=sha256:8af374fedb50c874cd832fb4957ca07f9cea841bce18dd628039859c28a55177

Observation 82fcb283-bb09-4b1a-9049-a6cfe95800a0 · outbound

This paper cites Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.774892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.774892Z digest=sha256:16023febac99e6622c4d0512945c98dd94cf2308347d14fc4ede19ad1edf1ac6

Observation e15905dd-f349-45d5-99cc-214640b79ca9 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.849321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.849321Z digest=sha256:c660bac612d9f583c4162f3059c7b0834c2efc759b2e9de8dd607550b981d4ee

Observation 74b6565b-6ce5-4490-8d0f-4d062136a615 · outbound

This paper cites Scaling laws for reward model overoptimization.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Scaling laws for reward model overoptimization

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.880391Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.880391Z digest=sha256:982ff4aa94e59daf0386892694ddc158ed2f751597bb1542cc020335d1018b5d

Observation 5f5c8744-c079-420c-8e47-fd3f29ceef97 · outbound

This paper cites Regularizing hidden states enables learning generalizable reward model for LLMs.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Regularizing hidden states enables learning generalizable reward model for LLMs

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.804692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:27.933380Z digest=sha256:2fcab68d9240f73075dfc5ff251018a5c69a4abcc598199f116c9712e7963e8a

Observation 72d56fc1-8a58-440d-b9d7-9e5b9069b774 · outbound

This paper cites Reinforced Self-Training (ReST) for Language Modeling.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Reinforced Self-Training (ReST) for Language Modeling

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:27.973611Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:27.973611Z digest=sha256:a2fbc63c21eaefa1bf2bf1018ac9d9c19afbaa79e09eda7c976a0b663c769de1

Observation 1f5ebdff-d09b-4348-a0a6-29c5c232a9a6 · outbound

This paper cites RAFT: Reward ranked finetuning for generative foundation model alignment.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary RAFT: Reward ranked finetuning for generative foundation model alignment

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.021151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.021151Z digest=sha256:e2a0159a12344325674e399305d9d54fc669572c384ea204b43dcc3bec279615

Observation 0fe264a2-4475-4269-a0e8-7d2a74d1a5dc · outbound

This paper cites BoNBon alignment for large language models and the sweetness of best-of-n sampling.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary BoNBon alignment for large language models and the sweetness of best-of-n sampling

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.783735Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.071734Z digest=sha256:e7bfac491cfcd9a39be75b6d4b1ba0d1e4a9d5edd52a0e6e8b7dc779e4269224

Observation e5ff2773-3700-4367-8456-dbbaae253d92 · outbound

This paper cites Reward model ensembles help mitigate overoptimization.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Reward model ensembles help mitigate overoptimization

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.771629Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.113633Z digest=sha256:a2d931acae1204b1b5572977e2e3fdf11af8e9060d9364daf674c897d23690db

Observation 2eceda81-b0f9-4057-8cee-6fd326be5e8f · outbound

This paper cites Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.145339Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.145339Z digest=sha256:d6d513f161029a5584a98011b0cf27be38b9c4909ff13f3b4b277f7b7ba59347

Observation 814af997-c937-4d52-ae31-db71d34520ce · outbound

This paper cites Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.177191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.177191Z digest=sha256:57a3c60f99ea11ecab70e702218a32fee5b8403882c766bc237987eeb66e050a

Observation 1327b6b7-25c7-43f0-9cc9-2622a2a96aa8 · outbound

This paper cites Reward-Robust RLHF in LLMs.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Reward-Robust RLHF in LLMs

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.248727Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.248727Z digest=sha256:a306174fae7dafaf9ce09e39a669dcd67b74f401f7ff8a5818ffa00b8ae80714

Observation 608ab5de-8333-4751-8d8c-66a9fe2ffdbd · outbound

This paper cites WARM: On the Benefits of Weight Averaged Reward Models.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary WARM: On the Benefits of Weight Averaged Reward Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.316657Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.316657Z digest=sha256:99a1c3fa14a34ec4925e9c2a344c0a6bf9267fa421930434b7f1a707a0f62250

Observation 32f17fb1-6713-426e-a30e-02e9f03beac8 · outbound

This paper cites Mitigating reward overoptimization via lightweight uncertainty estimation.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Mitigating reward overoptimization via lightweight uncertainty estimation

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.759487Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.384186Z digest=sha256:955c8749ddbde33a868bd342d5fd4a53f04f9d62b941cb9e8d7c035f21a40e55

Observation 15f94c9c-a771-4795-8152-1f2b9969f667 · outbound

This paper cites Confronting reward model overoptimization with constrained RLHF.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Confronting reward model overoptimization with constrained RLHF

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.746959Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.437380Z digest=sha256:7e5ed5914aacdc2e0e75d346d0c343bdccabbbb101fc42a87fb6c1a0e2c96677

Observation fd5e772f-2917-46fd-8d86-01b375aaf96e · outbound

This paper cites Provably mitigating overoptimization in RLHF: Your SFT loss is implicitly an adversarial regularizer.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Provably mitigating overoptimization in RLHF: Your SFT loss is implicitly an adversarial regularizer

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.733403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.473796Z digest=sha256:16e9a1272e6e5463a9f09c36bffc15fa3065e8fab684c1bcb392356cd2499a1d

Observation 0c6ff2cd-dc93-4461-8ad5-5cef5b5228ba · outbound

This paper cites Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.518998Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.518998Z digest=sha256:4f1912d0ea0e0b86ed3e91a59b4f51e8374cc7fbf33b3dd81c0c088c2d6d4e39

Observation 2670194a-a4ac-4f5c-9ff8-66c87f5a78b3 · outbound

This paper cites Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.540210Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.540210Z digest=sha256:a8ea40cc68eab6d13149e1ca95af72891b1089f56e11ef844cd091826cf19869

Observation 494dedb6-ce66-4401-a30c-8228dcc88c96 · outbound

This paper cites Odin: Disentangled reward mitigates hacking in rlhf.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Odin: Disentangled reward mitigates hacking in rlhf

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.721348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.617156Z digest=sha256:eaaa28dfaa860807f6f4d4cae3374261f49814c377baa63f4586ff35c5db106e

Observation d0ba9d10-7228-4b8c-a064-a26c851f1978 · outbound

This paper cites Mitigating reward over- optimization in RLHF via behavior-supported regularization.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Mitigating reward over- optimization in RLHF via behavior-supported regularization

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.709515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.693598Z digest=sha256:b9bbd6ee4119db0e74ac19319b5dbe12986ce78e619860c40bfc8ba9195ef3d6

Observation c8f808c6-1a69-4724-93a9-71a55743c510 · outbound

This paper cites Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.697634Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.806452Z digest=sha256:aef7bfbe5e5c5bb34881c6441564595be95c4a6588fc5283c22f333b9b8e8d5c

Observation 7d77ce26-f716-45ca-bb5b-e2e43879b913 · outbound

This paper cites Interpretable prefer- ences via multi-objective reward modeling and mixture-of-experts.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Interpretable prefer- ences via multi-objective reward modeling and mixture-of-experts

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.685515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:28.867409Z digest=sha256:5a1f3b538b7390f674ceb31d02f691b00e079d9f49e304d3d13d3ca2c32176fb

Observation 4d3b46b3-7012-40a1-ac29-651d3c92f037 · outbound

This paper cites Ultrafeedback: Boosting language models with high-quality feedback.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Ultrafeedback: Boosting language models with high-quality feedback

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:28.928468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:28.928468Z digest=sha256:a706b084847291955f281e4bd8eec5193367c18b30f85665546c03ea00cb8d1a

Observation 6344dd9b-6b44-4d70-b083-52e5626041df · outbound

This paper cites Prometheus: Inducing fine-grained evaluation capability in language models.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Prometheus: Inducing fine-grained evaluation capability in language models

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.665354Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:29.005900Z digest=sha256:0702fbccc41c3397e6cb3deccc7f0697a588e61584f4a9def83f083cf6e29de5

Observation 1478dc94-e347-43a8-92da-4b5205119c2f · outbound

This paper cites From generation to judgment: Opportunities and challenges of llm-as-a-judge.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary From generation to judgment: Opportunities and challenges of llm-as-a-judge

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:29.094023Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:29.094023Z digest=sha256:5e0363efa182a6e5dcbbbcbdd385f2de4465c4f66f7aa826381b63fbf2e0826b

Observation 96f1ab52-5e08-4ef2-b706-13e379c3b536 · outbound

This paper cites A Survey on LLM-as-a-Judge.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary A Survey on LLM-as-a-Judge

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:29.160362Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:29.160362Z digest=sha256:ac6ad5d416389ead66ed5a8a9719811a9629f4dc5c01591375cfe830ab05168b

Observation ea44deb3-73ba-46be-8e99-2794c093ef3d · outbound

This paper cites Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.653319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:29.231420Z digest=sha256:489d9faa469bbfb1733962507ddb7d733f450d70535421e1119d98f89d7272cc

Observation 9f64425d-4872-4be7-a1e0-8c8d38b36f77 · outbound

This paper cites Smith, and Hannaneh Hajishirzi.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Smith, and Hannaneh Hajishirzi

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:29.240975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:29.240975Z digest=sha256:6adc0009183df22361f8fc7562f78e729cee2cb4adef5c85a9a9438db7504789

Observation 40709b58-5608-47ca-9a4d-baea0722a49d · outbound

This paper cites RM-bench: Benchmarking reward models of language models with subtlety and style.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary RM-bench: Benchmarking reward models of language models with subtlety and style

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.633063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:29.323236Z digest=sha256:2b41c3cd83c66c9e6f3e2dc8eaa4036f836bf3590843fe8904c8cde305685669

Observation 1dc1b6a7-b1a6-4575-8604-bfd8e6e670a3 · outbound

This paper cites Rank analysis of incomplete block designs: I.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Rank analysis of incomplete block designs: I

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:29.387430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:29.387430Z digest=sha256:49a3cee4109c1a334e087936b7f7c4f26d4b7738790739bce138e7ef40d0ca0d

Observation 79436223-3dc2-4bc3-9038-6c364252e5ef · outbound

This paper cites HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:29.472946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:29.472946Z digest=sha256:076520b11a31275cec1768649527834b64f364395a6201c869bf5f1b45727122

Observation 2287ce39-6a6c-4864-8fb8-e7df4d8ab03a · outbound

This paper cites Arithmetic control of llms for diverse user preferences: Directional preference alignment with multi-objective rewards.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Arithmetic control of llms for diverse user preferences: Directional preference alignment with multi-objective rewards

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.612922Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:29.564625Z digest=sha256:648043a87b343a86dac5a6c9f2154895e5a8e3f8a6e5de4633141472afeadacd

Observation b72a5710-a58b-4182-82b3-2cbee629ab2d · outbound

This paper cites Learning to summarize with human feedback.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Learning to summarize with human feedback

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.600888Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:29.714855Z digest=sha256:6f76ce98616b757c7891286f0899b8e2018c41956cf6270b0f673af50da64ce4

Observation 5f5d77c5-b60c-443c-8d50-71c554792d2e · outbound

This paper cites Pairwise proximal policy optimization: Language model alignment with comparative RL.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Pairwise proximal policy optimization: Language model alignment with comparative RL

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.588864Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:29.761111Z digest=sha256:03453d2a91bde8b7389bf33d9cbc14a454aef51880c916b36c46d0a2e83d17ae

Observation ec020fda-7a9c-441e-8d44-2e09e60de4c1 · outbound

This paper cites Reward shaping to mitigate reward hacking in rlhf.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Reward shaping to mitigate reward hacking in rlhf

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:29.921637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:29.921637Z digest=sha256:8a2884b0cb1f5a70f5ca8d779a9870c696f6525067d43845b25cabc144710764

Observation ab2be653-9f15-48ff-adac-e8727d1f82d8 · outbound

This paper cites Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:29.978327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:29.978327Z digest=sha256:5febfc9208e07e762fc4220cef6becff8fe1678dfc72a27437a2fe606fe09139

Observation 16cdb465-159a-4ae4-b6a3-f0fb8839c954 · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Gemma: Open Models Based on Gemini Research and Technology

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:30.078239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:30.078239Z digest=sha256:7c39fde16586aa1c3c567fbd50b094ea6d83d39874a08774dd135dbfaeff1df0

Observation 1560d3f1-fc0a-4acf-8370-8e9b79abaaec · outbound

This paper cites Reward Model Ensembles Help Mitigate Overoptimization.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Reward Model Ensembles Help Mitigate Overoptimization

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:30.200216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:30.200216Z digest=sha256:d99ec4b634f4ec0b2a0fbdd4e56ab91f351a29eb212952c42125885fc7627c9b

Observation cd38fb7b-20d0-4846-8fab-b52ad404bc98 · outbound

This paper cites an unresolved cited work.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Unresolved cited work

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:30.310756Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:30.310756Z digest=sha256:e2cb1c1ab0ace4d5ee0db509330877cc146bfc5863bca03b13f5d1e340285c5b

Observation 67cd64a5-987a-4f44-983c-2810c38f8a4d · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:30.361244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:30.361244Z digest=sha256:62ec90ae3da8901a33ae48b8a385f1bbdc759dd21d7812055705342c86a68e99

Observation 27fdfeb5-0952-486b-a2b7-02ddb351d597 · outbound

This paper cites Secrets of RLHF in Large Language Models Part II: Reward Modeling.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Secrets of RLHF in Large Language Models Part II: Reward Modeling

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:30.462615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:30.462615Z digest=sha256:860e82bc9ef04519c493b7f528da7ab91b93b54d219e992ae3ea0de811809d24

Observation 205cb3df-66f4-4bad-8e25-0bb8575dc0c0 · outbound

This paper cites The Llama 3 Herd of Models.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary The Llama 3 Herd of Models

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:30.537923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:30.537923Z digest=sha256:0316885614ea8b463b61cf5b7f3df421244f1f50dab8739e19ecc6f7152537d3

Observation a96ce776-6d65-4285-b50a-1ad17fcbb364 · outbound

This paper cites RLHF Workflow: From Reward Modeling to Online RLHF.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary RLHF Workflow: From Reward Modeling to Online RLHF

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:30.659729Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:30.659729Z digest=sha256:c71c40c614e7f1a52feb980ec2cd3d07ad36a9c69d0cd26ae7647c6b1b84657b

Observation 31ae3f94-581a-41da-8b50-e41d5176c51d · outbound

This paper cites Rethinking reward model evaluation: Are we barking up the wrong tree? In The Thirteenth International Conference on Learning Representations, 2025.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Rethinking reward model evaluation: Are we barking up the wrong tree? In The Thirteenth International Conference on Learning Representations, 2025

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.568393Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:30.809814Z digest=sha256:38114fdd63a72e11f42a1ba417f252b554052653c22f927e6c02d2e3d64eaab0

Observation 4c137bbb-d842-4347-acf9-3bff36a85cbd · outbound

This paper cites What makes a reward model a good teacher? an optimization perspective.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary What makes a reward model a good teacher? an optimization perspective

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:30.935528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:30.935528Z digest=sha256:cd2f2ec071745ad0619a9b8f17387c5be1d157380a387f17b71a8195a500d0a7

Observation 1b1f0d2a-e239-4670-9539-70369bca1236 · outbound

This paper cites Mitigating the Alignment Tax of RLHF.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Mitigating the Alignment Tax of RLHF

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:31.112415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:31.112415Z digest=sha256:8d0dcd68dc9f39b88a72f8653840db104db01dee44f6c9b78f57e3722a20c445

Observation 918f8fce-fff4-4e9b-a382-65f69b82e97e · outbound

This paper cites Rethinking reward modeling in preference-based large language model alignment.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Rethinking reward modeling in preference-based large language model alignment

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.555746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:31.233347Z digest=sha256:f1f2a923763b6556f8a325e0f824feb5f70f08c514bb6e945f42b3427bffbf38

Observation 19f775c6-3d58-40b9-b8df-4c1f5703f672 · outbound

This paper cites Starling-7b: Improving llm helpfulness & harmlessness with rlaif.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Starling-7b: Improving llm helpfulness & harmlessness with rlaif

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.543076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:31.377631Z digest=sha256:cde9a170f3d5e59df23c310c9660917d2cd58029a2aa297eabd80fce3c0afb74

Observation 50cbdeac-a90e-489e-b035-53ad11c6274f · outbound

This paper cites Nemotron-4 340B Technical Report.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Nemotron-4 340B Technical Report

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:31.488714Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:31.488714Z digest=sha256:a732c469779090af3776eb9e8c07841b24977dfd6b6b066f699b7a4ca24b7fe0

Observation 8a7e88c4-c5a8-42ca-bc98-9dae587c9d73 · outbound

This paper cites Fine-grained human feedback gives better rewards for language model training.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Fine-grained human feedback gives better rewards for language model training

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.530381Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:31.600078Z digest=sha256:85cfa1eb5f288df6dce53add819071bc2c9eecbd00b635be65a307b47a8011e5

Observation 4885c4c4-937c-4e54-8052-92db587a203a · outbound

This paper cites Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment

Reference 65

Resolution
verified exact
local_arxiv, observed 2026-08-06T18:51:32.838655Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:31.661655Z digest=sha256:ca341528d790edb8890c5d1f9e360b70a4c637d515f8c99fe0e16d56454e1f4f

Observation 5f377fcb-db82-4eea-b21d-cbae3044e640 · outbound

This paper cites Chatbot arena: An open platform for evaluating llms by human preference.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Chatbot arena: An open platform for evaluating llms by human preference

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:31.757972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:31.757972Z digest=sha256:eb1baefb9fbc546f971162ca7c4cfba81133232688aa2820e1aedb722a77cffa

Observation 16812e59-4a34-4979-a196-8c672c4d8ea9 · outbound

This paper cites WebGPT: Browser-assisted question-answering with human feedback.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary WebGPT: Browser-assisted question-answering with human feedback

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:31.868564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:31.868564Z digest=sha256:5acd5a588da005cbf2c1de62e5277aef45a0e555adbe33285fa32daebe826726

Observation 25ade06b-4789-40c3-a681-cd6ab4084a6c · outbound

This paper cites Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:31.991836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:31.991836Z digest=sha256:1a397e394cf2dfeb3aaaf8c5c1d94e7d164fd6afe88f4bfbfa4b019e45370213

Observation 150a17bd-89d2-431a-a845-643f1bb027d4 · outbound

This paper cites Improve Mathematical Reasoning in Language Models by Automated Process Supervision.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Improve Mathematical Reasoning in Language Models by Automated Process Supervision

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:32.091323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:32.091323Z digest=sha256:c77d141c4d23f3ccde982fbe64651f0ea621ccf9f1b0c718f9c40d68f75099a5

Observation 0051497e-7fd1-4459-bdf7-3d22cd2c7d92 · outbound

This paper cites The Lessons of Developing Process Reward Models in Mathematical Reasoning.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary The Lessons of Developing Process Reward Models in Mathematical Reasoning

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:32.153438Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:32.153438Z digest=sha256:641c474d4cbde43f570ff206653a0314fc495422203e681e3c055ed6fd4b6a0e

Observation 99066ce0-bf66-45e2-bff9-babc6bf79869 · outbound

This paper cites Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:32.278911Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:32.278911Z digest=sha256:2c46143562f2c231ffbb7b2179261ed10b1173af83f2b804dbd87b7577231142

Observation d7c2a574-043f-4123-b3fc-d777dbdac109 · outbound

This paper cites RRM: Robust reward model training mitigates reward hacking.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary RRM: Robust reward model training mitigates reward hacking

Reference 72

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.509788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:32.330345Z digest=sha256:35f8dec01cc83f7fdfd61e57e796ae54f30aa61312125108762d50c1ba1246d1

Observation 666bbd5d-4176-40a4-904b-9923fbbc7e61 · outbound

This paper cites Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:32.462708Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:32.462708Z digest=sha256:bf2f323344d6be6687de3c1343c46f110234d29fdd1bbd91a67f70c407fdb32f

Observation fa9054b3-3428-413d-b2ae-2c0022526db6 · outbound

This paper cites Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.497789Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:32.533061Z digest=sha256:50a99544af2fcf04b68d5dcecadd39b7ee0122e70359dd89b712e524be735866

Observation 9a15a556-a843-4b42-99f9-210db24ee158 · outbound

This paper cites Convexity, classification, and risk bounds.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Convexity, classification, and risk bounds

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:32.639857Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:32.639857Z digest=sha256:283b1d21c4a64bf85aed6e9a48bdb75d6756cc93fa45ef0d875026c4c8629918

Observation 85d2ff92-4fe3-4ed2-9710-3c5df2a99dfa · outbound

This paper cites Fundamentals of statistical signal processing: estimation theory.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Fundamentals of statistical signal processing: estimation theory

Reference 76

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.476326Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:32.700936Z digest=sha256:8f8c7a12f590d0f65688f8d413cec3f49f3076955ecd439cd8f4e8f560c849b1

Observation e6a67e93-2552-4e32-97b0-f01c49869cd0 · outbound

This paper cites ARGS: Alignment as Reward-Guided Search.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary ARGS: Alignment as Reward-Guided Search

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-06T18:51:32.704726Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T18:51:32.704726Z digest=sha256:a2c905877e5f6fe32382a420209f7deb36183b9f213680b1347aa7d303a474d3

Observation 2b7b5efa-c7a1-4ef0-ad2d-3ba0f589c4ab · outbound

This paper cites Transformers: State- of-the-art natural language processing.

Bradley-Terry and Multi-Objective Reward Modeling Are Complementary Transformers: State- of-the-art natural language processing

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T18:51:33.464271Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-06T18:51:32.708316Z digest=sha256:e018e0eb9c2832d88f70a225ae1f9295163bce2fce46d50d7df513da2b96f694

Pith citing papers

No inbound Pith citation observations are available.