{"as_of":"2026-08-21T19:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0d6f665eaebc39dd7372aa089c0eead82fc95b8d1cc5f06a481bc13a22eb089c","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:51:32.708316Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07375/citation-record","integrity":"/paper/2507.07375/integrity","json":"/paper/2507.07375/citation-record.json","paper":"/paper/2507.07375"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:26.817729Z","title":"A survey on evaluation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.817729Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:943e3317ea27257a55ced243d8bb45f2eeca13947f3f92be0b0a1e2ce0a4af26","observation_id":"cd50d613-d633-4991-8971-8b128e83bfaf","resolution":{"observed_at":"2026-08-06T18:51:26.817729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.879679Z","title":"Using an llm to help with code understanding","venue":null,"work_id":"6654ff4a-2763-46b6-9641-c059a23c9a8b","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.900211Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:2752d04fec8d9c99e5847bb9d47955d4d1ef91467c718a6ef22046c35e5e76ad","observation_id":"7b4481ec-ba23-4c3d-b178-99c05edaff16","resolution":{"observed_at":"2026-08-06T18:51:33.883557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T18:51:26.955072Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.955072Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:86f54fc4067fb9748f901e62c538a0c751cdc28b637df3c13397a49d3e056589","observation_id":"0001cbad-5f0e-480a-8c10-ab04577d1bc4","resolution":{"observed_at":"2026-08-06T18:51:26.955072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03350","last_updated":"2024-12-28T09:18:36Z","snapshot_observed_at":"2026-08-20T00:11:27.877642Z","submitted_at":"2024-11-04T04:43:01Z","title":"A Comprehensive Survey of Small Language Models in the Era of Large Language Models: Techniques, Enhancements, Applications, Collaboration with LLMs, and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03350","snapshot_observed_at":"2026-08-06T18:51:26.988505Z","title":"A comprehensive survey of small language models in the era of large language models: Techniques, enhancements, applications, collaboration with llms, and trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:26.988505Z"},"links":{"cited_paper":"/paper/2411.03350","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:299a1d0597c0de038a5cd68a10e5dc38de53ed2e71f54ec82bb66ff83f65d198","observation_id":"30c80e4a-ccfe-41b7-ab00-f763bfd2ca55","resolution":{"observed_at":"2026-08-06T18:51:26.988505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00515","last_updated":"2024-11-10T22:02:27Z","snapshot_observed_at":"2026-08-14T16:40:35.729198Z","submitted_at":"2024-06-01T17:48:15Z","title":"A Survey on Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00515","snapshot_observed_at":"2026-08-06T18:51:27.064082Z","title":"A survey on large language models for code generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.064082Z"},"links":{"cited_paper":"/paper/2406.00515","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:3317c8c2ee032a2472ac9493c83f05cbe59b5ae4d020b2bf956360e7eac2afcc","observation_id":"25a11b13-7de4-405b-b82f-73cda5024c44","resolution":{"observed_at":"2026-08-06T18:51:27.064082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.867577Z","title":"Nguyen, Quang Pham, and Nghi D","venue":null,"work_id":"c8a378c8-936e-4d30-a1d6-f40e9c24df9f","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.130144Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:b27dba22e133b34faf96e71db0e9148ca2f0d89d64616a5f432869d995b0c0a0","observation_id":"916dd231-eeeb-4be9-8b3f-46bbd95effa9","resolution":{"observed_at":"2026-08-06T18:51:33.871249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.855570Z","title":"Rational decision-making agent with learning internal utility judgment","venue":null,"work_id":"72c568a0-ecb2-4acf-9bda-96cdceee2d87","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.192885Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:0236155deed18cf9d5b010f22250c093fed5f1378c4c5f390f6a2b8e36c15e27","observation_id":"5e740f70-b253-4026-90f8-c7df0600ac8c","resolution":{"observed_at":"2026-08-06T18:51:33.859303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18387","last_updated":"2025-02-26T06:40:18Z","snapshot_observed_at":"2026-08-18T01:11:20.362241Z","submitted_at":"2025-02-25T17:30:40Z","title":"How Far are LLMs from Real Search? A Comprehensive Study on Efficiency, Completeness, and Inherent Capabilities","version":2},"cited_work":{"arxiv_id":"2502.18387","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.18387","snapshot_observed_at":"2026-08-06T18:51:33.407502Z","title":"How Far are LLMs from Real Search? A Comprehensive Study on Efficiency, Completeness, and Inherent Capabilities","venue":"cs.AI","work_id":"5a82c6ab-009d-4eb9-b513-94627436cead","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.287880Z"},"links":{"cited_paper":"/paper/2502.18387","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:01d69099c661d54cb511b0516eb1d6037f43cbb044e98c34a45b37beee77e9c3","observation_id":"349be0f5-8bb4-44e0-a2ab-341f001069a5","resolution":{"observed_at":"2026-08-06T18:51:33.411523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.843217Z","title":"Safe RLHF: Safe reinforcement learning from human feedback","venue":null,"work_id":"1e1d05f5-5723-46a3-bc80-d5059152e30e","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.397407Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:811f750208bd7719e5bd7ea2d4307d3630a1eb00764e43e07048b1f860585e9e","observation_id":"77e7bd53-557f-4cd7-973b-dded99fde893","resolution":{"observed_at":"2026-08-06T18:51:33.847033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15453","last_updated":"2025-01-28T06:35:32Z","snapshot_observed_at":"2026-08-15T19:34:30.287297Z","submitted_at":"2025-01-26T08:49:46Z","title":"Data-adaptive Safety Rules for Training Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15453","snapshot_observed_at":"2026-08-06T18:51:27.438057Z","title":"Data-adaptive safety rules for training reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.438057Z"},"links":{"cited_paper":"/paper/2501.15453","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:189d7459feda9a6319ed99f7649f412dbaaed7da67388c4d69838445b7feaf58","observation_id":"69708228-e735-41ca-9311-dc586d66fc1f","resolution":{"observed_at":"2026-08-06T18:51:27.438057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15025","last_updated":"2023-09-26T15:49:23Z","snapshot_observed_at":"2026-08-20T05:44:35.013312Z","submitted_at":"2023-09-26T15:49:23Z","title":"Large Language Model Alignment: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15025","snapshot_observed_at":"2026-08-06T18:51:27.506062Z","title":"Large language model alignment: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.506062Z"},"links":{"cited_paper":"/paper/2309.15025","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:41097266e9a44a737d140409d8e7416ba07e588ce141e5ed65ce6988e5a05054","observation_id":"f7f6c85d-63e3-48c7-817c-802b866accaa","resolution":{"observed_at":"2026-08-06T18:51:27.506062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.829184Z","title":"Catastrophic failure of LLM unlearning via quantization","venue":null,"work_id":"acd3c79a-89b4-4e92-8002-7e33d47a9117","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.565861Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:0bf82678665201119f23b8aaf9ec71410f02885a2b0b09174d1c82b27a075c97","observation_id":"96ebcb40-f4e9-4f43-b29b-46b60683ab82","resolution":{"observed_at":"2026-08-06T18:51:33.832930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T18:51:27.611461Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.611461Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:2574f66134890d9ccd1fcffbf9911aee37d872387556b67a041e22ec9231db45","observation_id":"0ad21580-69cc-445f-aa0b-1c0e961d356a","resolution":{"observed_at":"2026-08-06T18:51:27.611461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:27.687717Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.687717Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:f363fd5bed402092e3f2a2ca0792fe56ee44362b2fbe086e26e7680617b57443","observation_id":"bd1fea6c-175a-4353-82c2-3ac45f6e46bc","resolution":{"observed_at":"2026-08-06T18:51:27.687717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T18:51:27.723709Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.723709Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:8af374fedb50c874cd832fb4957ca07f9cea841bce18dd628039859c28a55177","observation_id":"3b7edfe9-52ea-4f00-8d2a-2cbe30e2a777","resolution":{"observed_at":"2026-08-06T18:51:27.723709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-06T18:51:27.774892Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.774892Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:16023febac99e6622c4d0512945c98dd94cf2308347d14fc4ede19ad1edf1ac6","observation_id":"82fcb283-bb09-4b1a-9049-a6cfe95800a0","resolution":{"observed_at":"2026-08-06T18:51:27.774892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T18:51:27.849321Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.849321Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:c660bac612d9f583c4162f3059c7b0834c2efc759b2e9de8dd607550b981d4ee","observation_id":"e15905dd-f349-45d5-99cc-214640b79ca9","resolution":{"observed_at":"2026-08-06T18:51:27.849321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:27.880391Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.880391Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:982ff4aa94e59daf0386892694ddc158ed2f751597bb1542cc020335d1018b5d","observation_id":"74b6565b-6ce5-4490-8d0f-4d062136a615","resolution":{"observed_at":"2026-08-06T18:51:27.880391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.800945Z","title":"Regularizing hidden states enables learning generalizable reward model for LLMs","venue":null,"work_id":"1bc2f34b-e9a1-4a30-8f98-05e70a1ac760","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.933380Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:2fcab68d9240f73075dfc5ff251018a5c69a4abcc598199f116c9712e7963e8a","observation_id":"5f5c8744-c079-420c-8e47-fd3f29ceef97","resolution":{"observed_at":"2026-08-06T18:51:33.804692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-06T18:51:27.973611Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:27.973611Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:a2fbc63c21eaefa1bf2bf1018ac9d9c19afbaa79e09eda7c976a0b663c769de1","observation_id":"72d56fc1-8a58-440d-b9d7-9e5b9069b774","resolution":{"observed_at":"2026-08-06T18:51:27.973611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:28.021151Z","title":"RAFT: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.021151Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:e2a0159a12344325674e399305d9d54fc669572c384ea204b43dcc3bec279615","observation_id":"1f5ebdff-d09b-4348-a0a6-29c5c232a9a6","resolution":{"observed_at":"2026-08-06T18:51:28.021151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.779730Z","title":"BoNBon alignment for large language models and the sweetness of best-of-n sampling","venue":null,"work_id":"b40702ac-fdec-4986-9022-37613f893ee2","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.071734Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:e7bfac491cfcd9a39be75b6d4b1ba0d1e4a9d5edd52a0e6e8b7dc779e4269224","observation_id":"0fe264a2-4475-4269-a0e8-7d2a74d1a5dc","resolution":{"observed_at":"2026-08-06T18:51:33.783735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.767874Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":"be91d90d-37a2-4e34-b6a1-8a989b8553f7","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.113633Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:a2d931acae1204b1b5572977e2e3fdf11af8e9060d9364daf674c897d23690db","observation_id":"e5ff2773-3700-4367-8456-dbbaae253d92","resolution":{"observed_at":"2026-08-06T18:51:33.771629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-20T23:47:55.139025Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T18:51:28.145339Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.145339Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:d6d513f161029a5584a98011b0cf27be38b9c4909ff13f3b4b277f7b7ba59347","observation_id":"2eceda81-b0f9-4057-8cee-6fd326be5e8f","resolution":{"observed_at":"2026-08-06T18:51:28.145339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16635","last_updated":"2024-10-22T06:19:20Z","snapshot_observed_at":"2026-08-16T14:23:26.502705Z","submitted_at":"2024-01-30T00:17:37Z","title":"Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16635","snapshot_observed_at":"2026-08-06T18:51:28.177191Z","title":"Im- proving reinforcement learning from human feedback with efficient reward model ensemble","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.177191Z"},"links":{"cited_paper":"/paper/2401.16635","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:57a3c60f99ea11ecab70e702218a32fee5b8403882c766bc237987eeb66e050a","observation_id":"814af997-c937-4d52-ae31-db71d34520ce","resolution":{"observed_at":"2026-08-06T18:51:28.177191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15360","last_updated":"2024-10-16T14:56:15Z","snapshot_observed_at":"2026-08-16T13:17:39.160528Z","submitted_at":"2024-09-18T02:35:41Z","title":"Reward-Robust RLHF in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15360","snapshot_observed_at":"2026-08-06T18:51:28.248727Z","title":"Reward-robust rlhf in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.248727Z"},"links":{"cited_paper":"/paper/2409.15360","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:a306174fae7dafaf9ce09e39a669dcd67b74f401f7ff8a5818ffa00b8ae80714","observation_id":"1327b6b7-25c7-43f0-9cc9-2622a2a96aa8","resolution":{"observed_at":"2026-08-06T18:51:28.248727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-20T23:49:59.366823Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T18:51:28.316657Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.316657Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:99a1c3fa14a34ec4925e9c2a344c0a6bf9267fa421930434b7f1a707a0f62250","observation_id":"608ab5de-8333-4751-8d8c-66a9fe2ffdbd","resolution":{"observed_at":"2026-08-06T18:51:28.316657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.755569Z","title":"Mitigating reward overoptimization via lightweight uncertainty estimation","venue":null,"work_id":"0dda8cf2-80d3-4974-bab5-aef5086d4e8b","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.384186Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:955c8749ddbde33a868bd342d5fd4a53f04f9d62b941cb9e8d7c035f21a40e55","observation_id":"32f17fb1-6713-426e-a30e-02e9f03beac8","resolution":{"observed_at":"2026-08-06T18:51:33.759487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.742613Z","title":"Confronting reward model overoptimization with constrained RLHF","venue":null,"work_id":"d86e7fed-e97a-4b56-8e8c-9440369b96df","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.437380Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:7e5ed5914aacdc2e0e75d346d0c343bdccabbbb101fc42a87fb6c1a0e2c96677","observation_id":"15f94c9c-a771-4795-8152-1f2b9969f667","resolution":{"observed_at":"2026-08-06T18:51:33.746959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.729670Z","title":"Provably mitigating overoptimization in RLHF: Your SFT loss is implicitly an adversarial regularizer","venue":null,"work_id":"58c97766-57e9-4d06-991c-bc397708657d","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.473796Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:16e9a1272e6e5463a9f09c36bffc15fa3065e8fab684c1bcb392356cd2499a1d","observation_id":"fd5e772f-2917-46fd-8d86-01b375aaf96e","resolution":{"observed_at":"2026-08-06T18:51:33.733403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05171","last_updated":"2024-07-09T13:17:36Z","snapshot_observed_at":"2026-08-17T16:09:44.193682Z","submitted_at":"2024-03-08T09:20:12Z","title":"Overcoming Reward Overoptimization via Adversarial Policy Optimization with Lightweight Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05171","snapshot_observed_at":"2026-08-06T18:51:28.518998Z","title":"Overcom- ing reward overoptimization via adversarial policy optimization with lightweight uncertainty estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.518998Z"},"links":{"cited_paper":"/paper/2403.05171","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:4f1912d0ea0e0b86ed3e91a59b4f51e8374cc7fbf33b3dd81c0c088c2d6d4e39","observation_id":"0c6ff2cd-dc93-4461-8ad5-5cef5b5228ba","resolution":{"observed_at":"2026-08-06T18:51:28.518998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-16T14:12:33.096325Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-08-06T18:51:28.540210Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.540210Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:a8ea40cc68eab6d13149e1ca95af72891b1089f56e11ef844cd091826cf19869","observation_id":"2670194a-a4ac-4f5c-9ff8-66c87f5a78b3","resolution":{"observed_at":"2026-08-06T18:51:28.540210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.717709Z","title":"Odin: Disentangled reward mitigates hacking in rlhf","venue":null,"work_id":"beb3f289-442e-4b99-b38a-ed81c45d1d44","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.617156Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:eaaa28dfaa860807f6f4d4cae3374261f49814c377baa63f4586ff35c5db106e","observation_id":"494dedb6-ce66-4401-a30c-8228dcc88c96","resolution":{"observed_at":"2026-08-06T18:51:33.721348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.705835Z","title":"Mitigating reward over- optimization in RLHF via behavior-supported regularization","venue":null,"work_id":"2dc3ae7f-b19c-40e7-8ed7-2f746a1d38ed","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.693598Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:b9bbd6ee4119db0e74ac19319b5dbe12986ce78e619860c40bfc8ba9195ef3d6","observation_id":"d0ba9d10-7228-4b8c-a064-a26c851f1978","resolution":{"observed_at":"2026-08-06T18:51:33.709515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.693788Z","title":"Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":"d6ad942d-d429-4440-be85-ed0483b03439","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.806452Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:aef7bfbe5e5c5bb34881c6441564595be95c4a6588fc5283c22f333b9b8e8d5c","observation_id":"c8f808c6-1a69-4724-93a9-71a55743c510","resolution":{"observed_at":"2026-08-06T18:51:33.697634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.681770Z","title":"Interpretable prefer- ences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":"22882a44-22f3-4b1b-a6aa-f06d9f4e75ba","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.867409Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:5a1f3b538b7390f674ceb31d02f691b00e079d9f49e304d3d13d3ca2c32176fb","observation_id":"7d77ce26-f716-45ca-bb5b-e2e43879b913","resolution":{"observed_at":"2026-08-06T18:51:33.685515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:28.928468Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.928468Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:a706b084847291955f281e4bd8eec5193367c18b30f85665546c03ea00cb8d1a","observation_id":"4d3b46b3-7012-40a1-ac29-651d3c92f037","resolution":{"observed_at":"2026-08-06T18:51:28.928468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.661620Z","title":"Prometheus: Inducing fine-grained evaluation capability in language models","venue":null,"work_id":"f268ea72-33a2-4c20-9507-9a89060ca221","year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.005900Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:0702fbccc41c3397e6cb3deccc7f0697a588e61584f4a9def83f083cf6e29de5","observation_id":"6344dd9b-6b44-4d70-b083-52e5626041df","resolution":{"observed_at":"2026-08-06T18:51:33.665354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:29.094023Z","title":"From generation to judgment: Opportunities and challenges of llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.094023Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:5e0363efa182a6e5dcbbbcbdd385f2de4465c4f66f7aa826381b63fbf2e0826b","observation_id":"1478dc94-e347-43a8-92da-4b5205119c2f","resolution":{"observed_at":"2026-08-06T18:51:29.094023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-20T12:52:29.141935Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-06T18:51:29.160362Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.160362Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:ac6ad5d416389ead66ed5a8a9719811a9629f4dc5c01591375cfe830ab05168b","observation_id":"96f1ab52-5e08-4ef2-b706-13e379c3b536","resolution":{"observed_at":"2026-08-06T18:51:29.160362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.649744Z","title":"Zhang, Makesh Narsimhan Sreedhar, and Oleksii Kuchaiev","venue":null,"work_id":"ee57da3c-f282-48a3-b45e-e38e66265ada","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.231420Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:489d9faa469bbfb1733962507ddb7d733f450d70535421e1119d98f89d7272cc","observation_id":"ea44deb3-73ba-46be-8e99-2794c093ef3d","resolution":{"observed_at":"2026-08-06T18:51:33.653319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:29.240975Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.240975Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:6adc0009183df22361f8fc7562f78e729cee2cb4adef5c85a9a9438db7504789","observation_id":"9f64425d-4872-4be7-a1e0-8c8d38b36f77","resolution":{"observed_at":"2026-08-06T18:51:29.240975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.629236Z","title":"RM-bench: Benchmarking reward models of language models with subtlety and style","venue":null,"work_id":"3c5100d0-c9d3-40e4-8576-3af7023aa756","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.323236Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:2b41c3cd83c66c9e6f3e2dc8eaa4036f836bf3590843fe8904c8cde305685669","observation_id":"40709b58-5608-47ca-9a4d-baea0722a49d","resolution":{"observed_at":"2026-08-06T18:51:33.633063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:29.387430Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.387430Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:49a3cee4109c1a334e087936b7f7c4f26d4b7738790739bce138e7ef40d0ca0d","observation_id":"1dc1b6a7-b1a6-4575-8604-bfd8e6e670a3","resolution":{"observed_at":"2026-08-06T18:51:29.387430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09528","last_updated":"2023-11-16T03:13:29Z","snapshot_observed_at":"2026-08-16T14:42:50.641609Z","submitted_at":"2023-11-16T03:13:29Z","title":"HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09528","snapshot_observed_at":"2026-08-06T18:51:29.472946Z","title":"Helpsteer: Multi-attribute helpfulness dataset for steerlm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.472946Z"},"links":{"cited_paper":"/paper/2311.09528","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:076520b11a31275cec1768649527834b64f364395a6201c869bf5f1b45727122","observation_id":"79436223-3dc2-4bc3-9038-6c364252e5ef","resolution":{"observed_at":"2026-08-06T18:51:29.472946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.609094Z","title":"Arithmetic control of llms for diverse user preferences: Directional preference alignment with multi-objective rewards","venue":null,"work_id":"1cd9c1c0-0bc7-4264-ae98-f2768e3d767a","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.564625Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:648043a87b343a86dac5a6c9f2154895e5a8e3f8a6e5de4633141472afeadacd","observation_id":"2287ce39-6a6c-4864-8fb8-e7df4d8ab03a","resolution":{"observed_at":"2026-08-06T18:51:33.612922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.597409Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"00bfb848-a9ba-4dc3-a062-f63717170cc8","year":2020},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.714855Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:6f76ce98616b757c7891286f0899b8e2018c41956cf6270b0f673af50da64ce4","observation_id":"b72a5710-a58b-4182-82b3-2cbee629ab2d","resolution":{"observed_at":"2026-08-06T18:51:33.600888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.585104Z","title":"Pairwise proximal policy optimization: Language model alignment with comparative RL","venue":null,"work_id":"25ab4f5a-f53e-42b1-9144-f5867f1ec230","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.761111Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:03453d2a91bde8b7389bf33d9cbc14a454aef51880c916b36c46d0a2e83d17ae","observation_id":"5f5d77c5-b60c-443c-8d50-71c554792d2e","resolution":{"observed_at":"2026-08-06T18:51:33.588864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:29.921637Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.921637Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:8a2884b0cb1f5a70f5ca8d779a9870c696f6525067d43845b25cabc144710764","observation_id":"ec020fda-7a9c-441e-8d44-2e09e60de4c1","resolution":{"observed_at":"2026-08-06T18:51:29.921637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-06T18:51:29.978327Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:29.978327Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:5febfc9208e07e762fc4220cef6becff8fe1678dfc72a27437a2fe606fe09139","observation_id":"ab2be653-9f15-48ff-adac-e8727d1f82d8","resolution":{"observed_at":"2026-08-06T18:51:29.978327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T18:51:30.078239Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.078239Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:7c39fde16586aa1c3c567fbd50b094ea6d83d39874a08774dd135dbfaeff1df0","observation_id":"16cdb465-159a-4ae4-b6a3-f0fb8839c954","resolution":{"observed_at":"2026-08-06T18:51:30.078239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-19T21:21:24.687697Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-06T18:51:30.200216Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.200216Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:d99ec4b634f4ec0b2a0fbdd4e56ab91f351a29eb212952c42125885fc7627c9b","observation_id":"1560d3f1-fc0a-4acf-8370-8e9b79abaaec","resolution":{"observed_at":"2026-08-06T18:51:30.200216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:30.310756Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.310756Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:e2cb1c1ab0ace4d5ee0db509330877cc146bfc5863bca03b13f5d1e340285c5b","observation_id":"cd38fb7b-20d0-4846-8fab-b52ad404bc98","resolution":{"observed_at":"2026-08-06T18:51:30.310756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T18:51:30.361244Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.361244Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:62ec90ae3da8901a33ae48b8a385f1bbdc759dd21d7812055705342c86a68e99","observation_id":"67cd64a5-987a-4f44-983c-2810c38f8a4d","resolution":{"observed_at":"2026-08-06T18:51:30.361244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-19T19:05:07.043134Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-06T18:51:30.462615Z","title":"Secrets of rlhf in large language models part ii: Reward modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.462615Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:860e82bc9ef04519c493b7f528da7ab91b93b54d219e992ae3ea0de811809d24","observation_id":"27fdfeb5-0952-486b-a2b7-02ddb351d597","resolution":{"observed_at":"2026-08-06T18:51:30.462615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:51:30.537923Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.537923Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:0316885614ea8b463b61cf5b7f3df421244f1f50dab8739e19ecc6f7152537d3","observation_id":"205cb3df-66f4-4bad-8e25-0bb8575dc0c0","resolution":{"observed_at":"2026-08-06T18:51:30.537923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-21T09:07:22.148961Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-06T18:51:30.659729Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.659729Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:c71c40c614e7f1a52feb980ec2cd3d07ad36a9c69d0cd26ae7647c6b1b84657b","observation_id":"a96ce776-6d65-4285-b50a-1ad17fcbb364","resolution":{"observed_at":"2026-08-06T18:51:30.659729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.564170Z","title":"Rethinking reward model evaluation: Are we barking up the wrong tree? In The Thirteenth International Conference on Learning Representations, 2025","venue":null,"work_id":"14df0825-ca7b-4f99-9165-43ee2bf295a6","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.809814Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:38114fdd63a72e11f42a1ba417f252b554052653c22f927e6c02d2e3d64eaab0","observation_id":"31ae3f94-581a-41da-8b50-e41d5176c51d","resolution":{"observed_at":"2026-08-06T18:51:33.568393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:30.935528Z","title":"What makes a reward model a good teacher? an optimization perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.935528Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:cd2f2ec071745ad0619a9b8f17387c5be1d157380a387f17b71a8195a500d0a7","observation_id":"4c137bbb-d842-4347-acf9-3bff36a85cbd","resolution":{"observed_at":"2026-08-06T18:51:30.935528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06256","last_updated":"2024-10-13T19:27:20Z","snapshot_observed_at":"2026-08-21T08:31:42.500173Z","submitted_at":"2023-09-12T14:16:54Z","title":"Mitigating the Alignment Tax of RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06256","snapshot_observed_at":"2026-08-06T18:51:31.112415Z","title":"Mitigating the alignment tax of rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.112415Z"},"links":{"cited_paper":"/paper/2309.06256","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:8d0dcd68dc9f39b88a72f8653840db104db01dee44f6c9b78f57e3722a20c445","observation_id":"1b1f0d2a-e239-4670-9539-70369bca1236","resolution":{"observed_at":"2026-08-06T18:51:31.112415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.551436Z","title":"Rethinking reward modeling in preference-based large language model alignment","venue":null,"work_id":"5e748745-18bf-44ab-8291-251c610ababa","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.233347Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:f1f2a923763b6556f8a325e0f824feb5f70f08c514bb6e945f42b3427bffbf38","observation_id":"918f8fce-fff4-4e9b-a382-65f69b82e97e","resolution":{"observed_at":"2026-08-06T18:51:33.555746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.539243Z","title":"Starling-7b: Improving llm helpfulness & harmlessness with rlaif","venue":null,"work_id":"fa394cf9-53d6-467e-9972-d8bbf4d46d01","year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.377631Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:cde9a170f3d5e59df23c310c9660917d2cd58029a2aa297eabd80fce3c0afb74","observation_id":"19f775c6-3d58-40b9-b8df-4c1f5703f672","resolution":{"observed_at":"2026-08-06T18:51:33.543076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-20T10:53:55.991490Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-06T18:51:31.488714Z","title":"Nemotron-4 340b technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.488714Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:a732c469779090af3776eb9e8c07841b24977dfd6b6b066f699b7a4ca24b7fe0","observation_id":"50cbdeac-a90e-489e-b035-53ad11c6274f","resolution":{"observed_at":"2026-08-06T18:51:31.488714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.526622Z","title":"Fine-grained human feedback gives better rewards for language model training","venue":null,"work_id":"bd343dd6-e774-41e9-bf0f-45a33c0ac4e8","year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.600078Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:85cfa1eb5f288df6dce53add819071bc2c9eecbd00b635be65a307b47a8011e5","observation_id":"8a7e88c4-c5a8-42ca-bc98-9dae587c9d73","resolution":{"observed_at":"2026-08-06T18:51:33.530381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04072","last_updated":"2024-04-15T15:25:53Z","snapshot_observed_at":"2026-08-16T14:45:15.190206Z","submitted_at":"2023-11-07T15:36:40Z","title":"Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment","version":2},"cited_work":{"arxiv_id":"2311.04072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04072","snapshot_observed_at":"2026-08-06T18:51:32.832846Z","title":"Beyond Imitation: Leveraging Fine-grained Quality Signals for Alignment","venue":"cs.CL","work_id":"97b5e844-c147-4164-a408-191101c2eb83","year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.661655Z"},"links":{"cited_paper":"/paper/2311.04072","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:ca341528d790edb8890c5d1f9e360b70a4c637d515f8c99fe0e16d56454e1f4f","observation_id":"4885c4c4-937c-4e54-8052-92db587a203a","resolution":{"observed_at":"2026-08-06T18:51:32.838655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:31.757972Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.757972Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:eb1baefb9fbc546f971162ca7c4cfba81133232688aa2820e1aedb722a77cffa","observation_id":"5f377fcb-db82-4eea-b21d-cbae3044e640","resolution":{"observed_at":"2026-08-06T18:51:31.757972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-19T02:54:55.334346Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-06T18:51:31.868564Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.868564Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:5acd5a588da005cbf2c1de62e5277aef45a0e555adbe33285fa32daebe826726","observation_id":"16812e59-4a34-4979-a196-8c672c4d8ea9","resolution":{"observed_at":"2026-08-06T18:51:31.868564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-19T00:49:04.283297Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-06T18:51:31.991836Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:31.991836Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:1a397e394cf2dfeb3aaaf8c5c1d94e7d164fd6afe88f4bfbfa4b019e45370213","observation_id":"25ade06b-4789-40c3-a681-cd6ab4084a6c","resolution":{"observed_at":"2026-08-06T18:51:31.991836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-06T18:51:32.091323Z","title":"Improve mathematical reasoning in language models by automated process supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.091323Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:c77d141c4d23f3ccde982fbe64651f0ea621ccf9f1b0c718f9c40d68f75099a5","observation_id":"150a17bd-89d2-431a-a845-643f1bb027d4","resolution":{"observed_at":"2026-08-06T18:51:32.091323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-21T19:20:50.144406Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-06T18:51:32.153438Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.153438Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:ed393cc0c078d3ac8fc2d1aaa4c14b89328d3521c6b008db0b37b62a3fdf4d0b","observation_id":"0051497e-7fd1-4459-bdf7-3d22cd2c7d92","resolution":{"observed_at":"2026-08-06T18:51:32.153438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16335","last_updated":"2024-01-29T17:43:42Z","snapshot_observed_at":"2026-08-16T14:23:34.169885Z","submitted_at":"2024-01-29T17:43:42Z","title":"Iterative Data Smoothing: Mitigating Reward Overfitting and Overoptimization in RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16335","snapshot_observed_at":"2026-08-06T18:51:32.278911Z","title":"Iterative data smoothing: Mitigating reward overfitting and overoptimization in rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.278911Z"},"links":{"cited_paper":"/paper/2401.16335","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:2c46143562f2c231ffbb7b2179261ed10b1173af83f2b804dbd87b7577231142","observation_id":"99066ce0-bf66-45e2-bff9-babc6bf79869","resolution":{"observed_at":"2026-08-06T18:51:32.278911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.506151Z","title":"RRM: Robust reward model training mitigates reward hacking","venue":null,"work_id":"cab5503f-a46c-4c92-a03e-60cfcc507c7f","year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.330345Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:35f8dec01cc83f7fdfd61e57e796ae54f30aa61312125108762d50c1ba1246d1","observation_id":"d7c2a574-043f-4123-b3fc-d777dbdac109","resolution":{"observed_at":"2026-08-06T18:51:33.509788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-13T04:40:45.853560Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09620","snapshot_observed_at":"2026-08-06T18:51:32.462708Z","title":"Beyond reward hacking: Causal rewards for large language model alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.462708Z"},"links":{"cited_paper":"/paper/2501.09620","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:bf2f323344d6be6687de3c1343c46f110234d29fdd1bbd91a67f70c407fdb32f","observation_id":"666bbd5d-4176-40a4-904b-9923fbbc7e61","resolution":{"observed_at":"2026-08-06T18:51:32.462708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.493584Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling","venue":null,"work_id":"acb35345-7c41-496f-ab07-e12cfa1ffc42","year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.533061Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:50a99544af2fcf04b68d5dcecadd39b7ee0122e70359dd89b712e524be735866","observation_id":"fa9054b3-3428-413d-b2ae-2c0022526db6","resolution":{"observed_at":"2026-08-06T18:51:33.497789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:32.639857Z","title":"Convexity, classification, and risk bounds","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.639857Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:283b1d21c4a64bf85aed6e9a48bdb75d6756cc93fa45ef0d875026c4c8629918","observation_id":"9a15a556-a843-4b42-99f9-210db24ee158","resolution":{"observed_at":"2026-08-06T18:51:32.639857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.472711Z","title":"Fundamentals of statistical signal processing: estimation theory","venue":null,"work_id":"b97f734d-1fc2-4bfe-bdc6-fe9962139567","year":1993},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.700936Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:8f8c7a12f590d0f65688f8d413cec3f49f3076955ecd439cd8f4e8f560c849b1","observation_id":"85d2ff92-4fe3-4ed2-9710-3c5df2a99dfa","resolution":{"observed_at":"2026-08-06T18:51:33.476326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01694","last_updated":"2024-01-23T23:42:41Z","snapshot_observed_at":"2026-08-18T11:13:23.191794Z","submitted_at":"2024-01-23T23:42:41Z","title":"ARGS: Alignment as Reward-Guided Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01694","snapshot_observed_at":"2026-08-06T18:51:32.704726Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.704726Z"},"links":{"cited_paper":"/paper/2402.01694","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:a2c905877e5f6fe32382a420209f7deb36183b9f213680b1347aa7d303a474d3","observation_id":"e6a67e93-2552-4e32-97b0-f01c49869cd0","resolution":{"observed_at":"2026-08-06T18:51:32.704726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:51:33.460572Z","title":"Transformers: State- of-the-art natural language processing","venue":null,"work_id":"b0489410-321d-4e96-8493-7ddd9abb02b9","year":2020},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:32.708316Z"},"links":{"citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:e018e0eb9c2832d88f70a225ae1f9295163bce2fce46d50d7df513da2b96f694","observation_id":"2b7b5efa-c7a1-4ef0-ad2d-3ba0f589c4ab","resolution":{"observed_at":"2026-08-06T18:51:33.464271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T00:40:03.997660Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":2,"verified_fuzzy":29},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2507.07375."}