{"as_of":"2026-08-18T14:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a1de0afb8270a5809298b783d23d0fdad9c8e42d4ec790498ae81ad9b6e817e","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:48:02.087057Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06298/citation-record","integrity":"/paper/2506.06298/integrity","json":"/paper/2506.06298/citation-record.json","paper":"/paper/2506.06298"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.689640Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.689640Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d9e25d7449e640da2062523b09dee3407e915ed5d2c3ee42b555317cc89c7a6f","observation_id":"9cdf6fb2-6d4c-4115-b73a-32811ad29ac8","resolution":{"observed_at":"2026-08-15T20:48:01.689640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.695097Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.695097Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:c8be586418e9981d17ee5e759b01eb97b36ff0eef76487afb4fa003090fcb581","observation_id":"70ba490e-66da-4f4c-94ce-725d94732517","resolution":{"observed_at":"2026-08-15T20:48:01.695097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T20:48:01.699662Z","title":"Constitutional AI: Harmlessness from AI feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.699662Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:66962c1a7d208068c91a1df29a4e1fb9813a26e217ee13d7881259047149109b","observation_id":"7339a956-a618-4df3-a86c-75a82bd18d73","resolution":{"observed_at":"2026-08-15T20:48:01.699662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-15T20:48:01.704781Z","title":"Ethical and social risks of harm from language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.704781Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:26e6b77e1ef2e9e00e0f799295cd125bb20a5321191c77298cd67002698f454f","observation_id":"fa172a58-b6f2-454d-9fa6-f9d2ed86ca38","resolution":{"observed_at":"2026-08-15T20:48:01.704781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.709515Z","title":"Cultural palette: Pluralising culture alignment via multi-agent palette","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.709515Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:8ee7721f3ef9021599aaeed86a728c8e1a0a6cd2708807b6f9400bd6cac8c1d4","observation_id":"3e94affd-2d2d-4e06-9a65-da62c82a8978","resolution":{"observed_at":"2026-08-15T20:48:01.709515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13069","last_updated":"2022-11-19T18:45:02Z","snapshot_observed_at":"2026-08-16T16:14:52.002414Z","submitted_at":"2022-11-19T18:45:02Z","title":"Cultural Incongruencies in Artificial Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13069","snapshot_observed_at":"2026-08-15T20:48:01.714150Z","title":"Cultural incongruencies in artificial intelligence","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.714150Z"},"links":{"cited_paper":"/paper/2211.13069","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:fe19c8a4a4144187170cebaa159186dbddbf3e469b72558195cd3bba30c4bc92","observation_id":"639f046c-d067-47ec-9a8f-b984512cebb2","resolution":{"observed_at":"2026-08-15T20:48:01.714150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-18T08:23:26.325897Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-15T20:48:01.719440Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.719440Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:fd842efbc844e40f17f4b96a457125b3bd40767aac71412b82c8c44e260fb49a","observation_id":"e35e37ad-505c-43c1-8864-953fa84eed69","resolution":{"observed_at":"2026-08-15T20:48:01.719440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.724303Z","title":"The PRISM alignment dataset: What participatory, representative and individualised human feedback reveals about the subjective and multicultural alignment of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.724303Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:1311235e89265483ab4528025d2da27f1afaf58965713a6932bd5a08d90eae62","observation_id":"ce06337d-3332-4314-8b87-ac1269f7ba0a","resolution":{"observed_at":"2026-08-15T20:48:01.724303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-08-17T13:54:51.173809Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-15T20:48:01.728783Z","title":"MaxMin-RLHF: Towards equitable alignment of large language models with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.728783Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:6fd8298881d985815464e94466aa14ffeff0989628177213aab7b1103fdb201b","observation_id":"92a32861-6fb7-4f05-a88e-408eb1c934f7","resolution":{"observed_at":"2026-08-15T20:48:01.728783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-17T11:20:55.974248Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-15T20:48:01.734382Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.734382Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:edf007ea976a107d4f5017ae3f9aa3742166b6005e88473b77e5c9e469d6289b","observation_id":"5fdacdc4-d048-4817-bd2c-0e4a07642ded","resolution":{"observed_at":"2026-08-15T20:48:01.734382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.739314Z","title":"Whose opinions do language models reflect? InProceedings of the 40th In- ternational Conference on Machine Learning (ICML), pages 29971–30004, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.739314Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:6ce176339e802fde206898492ed725ac891d383cf2c35679c9f1675b0592da58","observation_id":"d9f14b31-9c5f-464e-b28d-dcc493fa7fa7","resolution":{"observed_at":"2026-08-15T20:48:01.739314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09251","last_updated":"2022-12-19T05:13:52Z","snapshot_observed_at":"2026-08-14T22:08:45.647927Z","submitted_at":"2022-12-19T05:13:52Z","title":"Discovering Language Model Behaviors with Model-Written Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09251","snapshot_observed_at":"2026-08-15T20:48:01.743851Z","title":"Discovering language model behaviors with model-written evaluations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.743851Z"},"links":{"cited_paper":"/paper/2212.09251","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:e099e0c06400275c97cc4c76d1a0e816fce6cab15cb2cf14afa24146aafc149d","observation_id":"acf8846c-cc79-4603-b4c0-09a3af831728","resolution":{"observed_at":"2026-08-15T20:48:01.743851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05453","last_updated":"2023-03-09T17:52:07Z","snapshot_observed_at":"2026-08-16T17:49:19.639103Z","submitted_at":"2023-03-09T17:52:07Z","title":"Personalisation within bounds: A risk taxonomy and policy framework for the alignment of large language models with personalised feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05453","snapshot_observed_at":"2026-08-15T20:48:01.748505Z","title":"Personalisation within bounds: A risk taxonomy and policy framework for the alignment of large language models with personalised feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.748505Z"},"links":{"cited_paper":"/paper/2303.05453","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:58012af683b1c76f2e5abf07c8c3c071ecc1d96baa0d0a29ca7d57b8a14c57b6","observation_id":"14c9880d-6b35-4781-ba18-26cdf04987b8","resolution":{"observed_at":"2026-08-15T20:48:01.748505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.753507Z","title":"Diverse preference learning for capabilities and alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.753507Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:9283b7f11a1ed0a70d6ca64afdd34157ecd1ce2e33ea6e08539d307f3da94635","observation_id":"35151b6b-0437-41c1-849f-371af5026d5b","resolution":{"observed_at":"2026-08-15T20:48:01.753507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:48:01.757851Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.757851Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f5f3d7b177e6a60c1d646abbf18e6345e23e5a36feffe7848cf49999f4c51b88","observation_id":"3af7a9e5-cea5-48c3-8f64-16e7292dfe43","resolution":{"observed_at":"2026-08-15T20:48:01.757851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16455","last_updated":"2025-08-25T01:01:38Z","snapshot_observed_at":"2026-08-16T13:49:22.343595Z","submitted_at":"2024-05-26T07:00:05Z","title":"On the Algorithmic Bias of Aligning Large Language Models with RLHF: Preference Collapse and Matching Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16455","snapshot_observed_at":"2026-08-15T20:48:01.762381Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.762381Z"},"links":{"cited_paper":"/paper/2405.16455","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:908cdf7dfa1e581c4dada9dcf07cf1cb1d3b0497707d9393caa391f62f12a52a","observation_id":"159f1a61-bbf6-4644-be8a-f63f2547f41a","resolution":{"observed_at":"2026-08-15T20:48:01.762381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.767496Z","title":"Evaluating the diversity and quality of LLM generated content","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.767496Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:8957235e21c590d0d49a8e567f574bbb7c2a8a274af648bf07acf96ce54d0aaa","observation_id":"d13e0bd2-1a64-44d7-be10-88ee55e94d7d","resolution":{"observed_at":"2026-08-15T20:48:01.767496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17692","last_updated":"2025-05-12T16:11:53Z","snapshot_observed_at":"2026-08-17T16:59:15.787489Z","submitted_at":"2024-06-25T16:32:33Z","title":"From Distributional to Overton Pluralism: Investigating Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2406.17692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17692","snapshot_observed_at":"2026-08-15T20:48:02.593491Z","title":"From Distributional to Overton Pluralism: Investigating Large Language Model Alignment","venue":"cs.CL","work_id":"8c0f7028-3141-43e0-9437-dc5e0a0dcbf1","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.771882Z"},"links":{"cited_paper":"/paper/2406.17692","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b21a517e662149c7b62d0109079500cc709dd0f69e7bf5d9948c4ee1c20645cf","observation_id":"2ba3f9d5-8324-4c5f-a78c-d5bb1821f2f2","resolution":{"observed_at":"2026-08-15T20:48:02.598897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-08-14T15:51:49.712613Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-15T20:48:01.776628Z","title":"Understanding the effects of RLHF on LLM generalisation and diversity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.776628Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b4af9327470c1dc6985f12ff9182a61296b097c94c7572dbba5cc12ba46abc0e","observation_id":"68c4f98c-df94-4fab-8410-6d339079d768","resolution":{"observed_at":"2026-08-15T20:48:01.776628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.476237Z","title":"A distributional approach to con- trolled text generation","venue":null,"work_id":"8cdb47b0-3580-440e-a17c-70e5b114f33e","year":2021},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.781209Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:fdbd574a9a1243ad773be40f80ef7985b98bfcdcb3961657ba527fdde7477616","observation_id":"e10d18e0-7a0d-4760-b54c-eeff2e81da64","resolution":{"observed_at":"2026-08-15T20:48:03.481429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-15T20:48:01.785525Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.785525Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f4cc2ab38dcf8cf09d9db7355c4067f6f2f74db0a706094bfc3e70f6f2835a59","observation_id":"71fe6e7a-cebc-475c-aadb-d437e6ea5d12","resolution":{"observed_at":"2026-08-15T20:48:01.785525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15951","last_updated":"2024-10-11T00:05:03Z","snapshot_observed_at":"2026-08-16T13:40:28.103117Z","submitted_at":"2024-06-22T22:07:40Z","title":"Modular Pluralism: Pluralistic Alignment via Multi-LLM Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15951","snapshot_observed_at":"2026-08-15T20:48:01.790093Z","title":"Modular pluralism: Pluralistic alignment via multi-LLM collaboration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.790093Z"},"links":{"cited_paper":"/paper/2406.15951","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:678b28aa456e79cd4eeedcc5b813959eea470b2a78aa75679a19382dfabc89fa","observation_id":"4a83cf32-3f50-49fd-b428-a28cf50605b0","resolution":{"observed_at":"2026-08-15T20:48:01.790093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05070","last_updated":"2024-08-20T19:14:31Z","snapshot_observed_at":"2026-08-14T17:53:51.886327Z","submitted_at":"2024-02-07T18:21:17Z","title":"A Roadmap to Pluralistic Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05070","snapshot_observed_at":"2026-08-15T20:48:01.795036Z","title":"A roadmap to pluralistic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.795036Z"},"links":{"cited_paper":"/paper/2402.05070","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:5084b5d7d58fe5235bde3023351c7d5fd4a0bb450cea207b7b6606cd53fdf347","observation_id":"b9a889e0-599c-4e59-93fe-719449655e14","resolution":{"observed_at":"2026-08-15T20:48:01.795036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00254","last_updated":"2024-05-27T14:08:40Z","snapshot_observed_at":"2026-08-16T13:56:25.795152Z","submitted_at":"2024-04-30T23:57:23Z","title":"RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00254","snapshot_observed_at":"2026-08-15T20:48:01.799802Z","title":"RLHF from heterogeneous feedback via personalization and preference aggregation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.799802Z"},"links":{"cited_paper":"/paper/2405.00254","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:f5e4e81202b65656a8e3124f70f050fdfdfec969b04d672d88d2eeeba978afb8","observation_id":"9afab7f9-7422-4192-9331-2eaeca87a3f1","resolution":{"observed_at":"2026-08-15T20:48:01.799802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.460766Z","title":"Pal: Pluralistic align- ment framework for learning from heterogeneous preferences","venue":null,"work_id":"44a5a4c0-44c2-46ef-b77a-c6737118c342","year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.804641Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:3a7e4175bfaf55904ebb0d7ecae7d071f71092ac19a8f7b0d8db9b3627c84e20","observation_id":"4f8c0b98-8283-40b6-9c97-c04c0b0df8ff","resolution":{"observed_at":"2026-08-15T20:48:03.465858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.809500Z","title":"Value profiles for encoding human variation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.809500Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d20fe977d3cbd98824ee43caebccb4e2ca2e9510901a3e58d2ff77aae2ff509f","observation_id":"63db3e0f-edad-4f23-b2da-10a5d65cdd18","resolution":{"observed_at":"2026-08-15T20:48:01.809500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.445937Z","title":"Aligning language models to user opinions","venue":null,"work_id":"0d24e6b7-742d-402d-a671-97b29957d3e6","year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.814140Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:db9562c0b122d0231a8ccd21f6d57207c92208a53c77a2150a86399f52bca0e4","observation_id":"86f24656-82b8-4d5b-a69d-ab27df243774","resolution":{"observed_at":"2026-08-15T20:48:03.450858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17387","last_updated":"2024-07-24T16:11:39Z","snapshot_observed_at":"2026-08-16T13:31:22.334408Z","submitted_at":"2024-07-24T16:11:39Z","title":"PERSONA: A Reproducible Testbed for Pluralistic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17387","snapshot_observed_at":"2026-08-15T20:48:01.818699Z","title":"Persona: A reproducible testbed for pluralistic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.818699Z"},"links":{"cited_paper":"/paper/2407.17387","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:60369023086a63755b9eb206da8dbbccb77e3d4f27dbaf395016a49dfe5ef69f","observation_id":"a0784958-be4e-4247-9404-df337da1a635","resolution":{"observed_at":"2026-08-15T20:48:01.818699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.429928Z","title":"Position: Social choice should guide AI alignment in dealing with diverse human feedback","venue":null,"work_id":"974402ed-8b1b-425d-8460-ebe9e568adbc","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.823584Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:4da233e9fad83724dc57a2100cb221b48c234316fc4d1533ddbf556e05298e4e","observation_id":"698c0fc2-e1ef-4d14-99e0-89377ea61f82","resolution":{"observed_at":"2026-08-15T20:48:03.435220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16048","last_updated":"2023-10-24T17:59:04Z","snapshot_observed_at":"2026-08-16T14:49:14.404796Z","submitted_at":"2023-10-24T17:59:04Z","title":"AI Alignment and Social Choice: Fundamental Limitations and Policy Implications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16048","snapshot_observed_at":"2026-08-15T20:48:01.828061Z","title":"Ai alignment and social choice: Fundamental limitations and policy implica- tions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.828061Z"},"links":{"cited_paper":"/paper/2310.16048","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:79f254969a4c45d98f2f718e99ef450b98aaa85766ce83b2b0fab10c5b74bd04","observation_id":"86a81d0f-acb5-4f2f-a64a-521805225db2","resolution":{"observed_at":"2026-08-15T20:48:01.828061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.414729Z","title":"Rewarded soups: towards Pareto-optimal alignment by inter- polating weights fine-tuned on diverse rewards","venue":null,"work_id":"5b269518-ddfd-46e3-9f56-a3287c2ddc26","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.832779Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:3f9ffb000ac5a268482301687fbc3e140c7a01e9772ce3b54538f31f35693655","observation_id":"56eddf10-da18-4237-864c-a12fde9743d9","resolution":{"observed_at":"2026-08-15T20:48:03.419841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.399537Z","title":"Axioms for AI alignment from human feedback","venue":null,"work_id":"06d5b050-d902-4aed-a65a-a4f641c59c77","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.837286Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:6bba3145dee0223550fba91cb782a897b2f3d57f97a56a6bfb629e878385971b","observation_id":"ae4a6ea4-8b0c-47e2-8838-33d4382ea6f5","resolution":{"observed_at":"2026-08-15T20:48:03.404613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14953","last_updated":"2025-04-17T18:52:54Z","snapshot_observed_at":"2026-08-16T13:50:02.540059Z","submitted_at":"2024-05-23T18:01:11Z","title":"MallowsPO: Fine-Tune Your LLM with Preference Dispersions","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14953","snapshot_observed_at":"2026-08-15T20:48:01.841780Z","title":"Mallowspo: Fine- tune your LLM with preference dispersions.arXiv preprint arXiv:2405.14953, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.841780Z"},"links":{"cited_paper":"/paper/2405.14953","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:1f732260c8048be9ae3aa7b3cd69a4b23dbe97fece82eefe0fc24dda64492532","observation_id":"29803dee-02c0-4edb-9639-44868b298edc","resolution":{"observed_at":"2026-08-15T20:48:01.841780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.384673Z","title":"Adaptive preference scaling for reinforcement learning with human feedback.Advances in Neural Information Processing Systems, 37:107249–107269, 2024","venue":null,"work_id":"9f23994a-8558-4976-801e-3b4fccf16ec4","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.847004Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:9d0b416adf9a9ff447e6a7f2cdd64fe23d3309c733b174215fbeceef36494bf7","observation_id":"785ee3d6-2cdb-4148-ae12-22e73a41099a","resolution":{"observed_at":"2026-08-15T20:48:03.389516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.369487Z","title":"Aligning language models with human preferences via a Bayesian approach.Advances in Neural Information Processing Systems, 36:49113–49132, 2023","venue":null,"work_id":"ba0e9aa9-2a22-49bb-ac9b-89ee63eab54f","year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.851648Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:8597d8662c82d71916c9d1fe3b859b0cc287c7a5676161c23175588d75620e4e","observation_id":"75bbd463-a625-4d0f-9820-c32a7ecf21a8","resolution":{"observed_at":"2026-08-15T20:48:03.375202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10075","last_updated":"2024-08-19T15:18:30Z","snapshot_observed_at":"2026-08-16T13:25:29.397694Z","submitted_at":"2024-08-19T15:18:30Z","title":"Personalizing Reinforcement Learning from Human Feedback with Variational Preference Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10075","snapshot_observed_at":"2026-08-15T20:48:01.856173Z","title":"Personal- izing reinforcement learning from human feedback with variational preference learning.arXiv preprint arXiv:2408.10075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.856173Z"},"links":{"cited_paper":"/paper/2408.10075","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:bb5fa434aaa98ea0904ce5c52e962bff166661084ec8314ea5421030f528d5a4","observation_id":"03485a93-87f0-4c0d-9417-abe1c126be11","resolution":{"observed_at":"2026-08-15T20:48:01.856173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16320","last_updated":"2025-02-22T18:46:33Z","snapshot_observed_at":"2026-08-18T09:14:17.624658Z","submitted_at":"2025-02-22T18:46:33Z","title":"Direct Alignment with Heterogeneous Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16320","snapshot_observed_at":"2026-08-15T20:48:01.861096Z","title":"Direct alignment with heterogeneous preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.861096Z"},"links":{"cited_paper":"/paper/2502.16320","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d12b6eaa7f409fa52895334cc23cdc52d1f42401065da5c218169096c30edd00","observation_id":"6dab271b-b97c-45a1-9e9e-b1aaac5e938e","resolution":{"observed_at":"2026-08-15T20:48:01.861096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.354544Z","title":"Distributional preference learning: Understanding and accounting for hidden context in RLHF","venue":null,"work_id":"ba5fb72f-4ecd-4194-9687-0f6063ad49cd","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.865792Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:569699afa66525957b3b7d7f033848d9219dead2296ea53e3b98e833c4b378b9","observation_id":"49435cce-d04d-408b-81a5-bc3dc7da52f0","resolution":{"observed_at":"2026-08-15T20:48:03.359673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.339802Z","title":"Clone-robust AI alignment","venue":null,"work_id":"eb9cab30-9d66-4c7b-9b71-90f0d9f3b579","year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.870515Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:20154e50cb1f534eeee275e8c7d3b661ece3f494561023c6eb57721815e6f126","observation_id":"affd01f2-7976-46e7-b9b2-8b12efb51183","resolution":{"observed_at":"2026-08-15T20:48:03.344695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.325275Z","title":"Fine-tuning language models to find agreement among humans with diverse preferences","venue":null,"work_id":"7ea2d5c6-115a-4b6a-aa99-f8da9161b5f5","year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.875008Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:91e864a388ca85a9c7550e3a6bdd9672280c9e44ca5eda2727513172614b2f85","observation_id":"e95f78dc-4ad8-4b15-ba12-ff7ecfc780b4","resolution":{"observed_at":"2026-08-15T20:48:03.330247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.309928Z","title":"Generative social choice","venue":null,"work_id":"09b6d689-4240-43f3-9870-5fa6ea18ab70","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.879425Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:ca4114c9d50a9b3e3a64da8cf38a7a23960fee6aa43162578e2faac519964778","observation_id":"8d68ede3-4ed2-489e-99ac-ef9682074c62","resolution":{"observed_at":"2026-08-15T20:48:03.314894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.294744Z","title":"Cambridge University Press, 2016","venue":null,"work_id":"195ae10c-8a7a-478f-ae46-8d05945b5e49","year":2016},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.884407Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:72e0bba08223d4b144c6bf6e2a38ee0a4e8a733bec17ca784f10b2f85405c0c7","observation_id":"efc9fa8e-acb6-4e16-97a0-f4712cbfc0ca","resolution":{"observed_at":"2026-08-15T20:48:03.299791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.278413Z","title":"The MIT Press, 2012","venue":null,"work_id":"d520743c-4ac6-4d0b-ad14-b0052ec1567f","year":2012},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.889050Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:12aab33087393d0a12d9946565a09a1133c33e1946d873ee9b6763c40bb71053","observation_id":"253a9dc8-2cd6-4250-89ac-a830d7207e8e","resolution":{"observed_at":"2026-08-15T20:48:03.283693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.262266Z","title":"Friedman.The Elements of Statistical Learning: Data Mining, Inference, and Prediction","venue":null,"work_id":"cffe39cd-547a-4494-8d33-e3b64d985102","year":2009},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.893532Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:432765bdcf77fdbecd105bc698cb173991e4a5305448cc1cb4156f35bfe5f383","observation_id":"ec96dc32-8717-49ca-af32-fc5850bab84c","resolution":{"observed_at":"2026-08-15T20:48:03.267712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07629","last_updated":"2023-10-11T16:18:13Z","snapshot_observed_at":"2026-08-17T03:30:03.754636Z","submitted_at":"2023-10-11T16:18:13Z","title":"The Past, Present and Better Future of Feedback Learning in Large Language Models for Subjective Human Preferences and Values","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07629","snapshot_observed_at":"2026-08-15T20:48:01.897987Z","title":"The past, present and better future of feedback learning in large language models for subjective human preferences and values","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.897987Z"},"links":{"cited_paper":"/paper/2310.07629","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d25595415e0dbba2bb50acb63c89a2a18ff8e950bf5c9f889f3e4f7760363ad2","observation_id":"fd56e2fd-a61f-438f-ba76-c7cc5bb8fbbc","resolution":{"observed_at":"2026-08-15T20:48:01.897987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.246734Z","title":"Zhang, Xinyi Chen, Qiuyi Zhang, Rajesh Ranganath, and Kyunghyun Cho","venue":null,"work_id":"61997e8e-4de4-4f43-9d3c-4aab4769e8a2","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.902944Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:4d83ac5b61cdf523e371c848e6e0799ef9157c51c2292eded308673402500554","observation_id":"227dcb78-9b0b-4339-a040-acbd71f33b58","resolution":{"observed_at":"2026-08-15T20:48:03.251842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03145","last_updated":"2025-06-28T08:52:35Z","snapshot_observed_at":"2026-08-16T13:12:43.059162Z","submitted_at":"2024-10-04T04:56:11Z","title":"Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback","version":2},"cited_work":{"arxiv_id":"2410.03145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.03145","snapshot_observed_at":"2026-08-15T20:48:02.349326Z","title":"Margin Matching Preference Optimization: Enhanced Model Alignment with Granular Feedback","venue":"cs.CL","work_id":"cbab9692-740f-480f-b57b-fe2fc109d927","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.907418Z"},"links":{"cited_paper":"/paper/2410.03145","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:c33fc3527205be11ab8ec04cd9c53e3f6ea553d676a142553212092088dfa911","observation_id":"5c7c0e2d-2551-49a5-865e-9f608fd4fdad","resolution":{"observed_at":"2026-08-15T20:48:02.354507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13595","last_updated":"2023-11-28T18:16:11Z","snapshot_observed_at":"2026-08-16T14:50:20.702051Z","submitted_at":"2023-10-20T15:45:16Z","title":"The History and Risks of Reinforcement Learning and Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13595","snapshot_observed_at":"2026-08-15T20:48:01.912071Z","title":"The history and risks of reinforcement learning and human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.912071Z"},"links":{"cited_paper":"/paper/2310.13595","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:cc62e5ec69bc5a8907520319744b6d544ec62e8e89928a59ef1620e741637abd","observation_id":"1280f3ce-1fdc-400d-b91c-575810737842","resolution":{"observed_at":"2026-08-15T20:48:01.912071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.229956Z","title":"Online, 2024","venue":null,"work_id":"865df2ca-4dc0-4eb5-9cac-b700a8f4bb02","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.916808Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:05ec72fa2f7840695ffd64b28d08047547d2436349be787c44ed0fdb600a474f","observation_id":"0d49b89c-d001-4ec0-9d58-7f6cb594d343","resolution":{"observed_at":"2026-08-15T20:48:03.235927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05699","last_updated":"2021-10-12T02:35:45Z","snapshot_observed_at":"2026-08-17T11:10:04.213131Z","submitted_at":"2021-10-12T02:35:45Z","title":"On Releasing Annotator-Level Labels and Information in Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05699","snapshot_observed_at":"2026-08-15T20:48:01.921683Z","title":"On releasing annotator- level labels and information in datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.921683Z"},"links":{"cited_paper":"/paper/2110.05699","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:9c5143da254eb7e41aea1196cd29b20ac2ecab526ca0964c208f9dfbe247ccea","observation_id":"fa6e8956-26d6-4f30-8159-29adfa2adbac","resolution":{"observed_at":"2026-08-15T20:48:01.921683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-17T08:35:42.452149Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-15T20:48:01.926116Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.926116Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:5ba8fbac3bc060e3fe03f668c1411d5e09dd2624dd9b058ff6a721b5798cace7","observation_id":"b5077209-3c03-4eb2-bb8c-524b12307462","resolution":{"observed_at":"2026-08-15T20:48:01.926116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.212970Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"a6a4205b-bc47-4f1d-8895-25097b69576e","year":2020},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.930838Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:c13c46901e70e35b0d6dcd88b9f9c008a2d5e164e1eb22a972a0b19539b8bb8e","observation_id":"89f27be0-ed2b-4887-ae0f-e240261f9f85","resolution":{"observed_at":"2026-08-15T20:48:03.218381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:48:01.935483Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.935483Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7dbd944657a1c3a875cd34c436ed6e8b4fa56ac223b387d9c5855357f13e7641","observation_id":"2d899908-36cb-4678-90c9-69fdc6380333","resolution":{"observed_at":"2026-08-15T20:48:01.935483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T20:48:01.940245Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.940245Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d22f5403a8c05397eb699bc55537021be3adb0f97181d4a11239c42e7fe3dc81","observation_id":"09229ffe-71b9-4f64-aee0-fd9c39e28639","resolution":{"observed_at":"2026-08-15T20:48:01.940245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.196859Z","title":"When does label smoothing help? InProceedings of the 32th Annual Conference on Neural Information Processing Systems (NeurIPS), 2019","venue":null,"work_id":"31f5b279-b4ed-4237-99fb-60ac67bb61f3","year":2019},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.945188Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:d27ea79dd55d7a0e6304a9e513653e944bf61e55f85c3d437ea83250bec419e2","observation_id":"935f7d17-e601-4d86-abb9-3b473bba900a","resolution":{"observed_at":"2026-08-15T20:48:03.202026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-16T14:28:08.540549Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-15T20:48:01.949682Z","title":"Secrets of RLHF in large language models part ii: Reward modeling.arXiv preprint arXiv:2401.06080, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.949682Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:a724d4c049c0c3e6c4e57bb4d143b2df45b6e24d31696b4138612b44e611ae71","observation_id":"0b0cd5c5-7278-4c5a-a7b3-0ea7ca8dfc02","resolution":{"observed_at":"2026-08-15T20:48:01.949682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22891","last_updated":"2024-10-30T10:39:34Z","snapshot_observed_at":"2026-08-17T20:55:16.975703Z","submitted_at":"2024-10-30T10:39:34Z","title":"VPO: Leveraging the Number of Votes in Preference Optimization","version":1},"cited_work":{"arxiv_id":"2410.22891","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.22891","snapshot_observed_at":"2026-08-15T20:48:02.240401Z","title":"VPO: Leveraging the Number of Votes in Preference Optimization","venue":"cs.LG","work_id":"b394dbb4-c453-4267-9b32-6bbf80a2a2af","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.954352Z"},"links":{"cited_paper":"/paper/2410.22891","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:9469d75ca2a40d4c3234a59d627c9a6af2ce309084e3919cb688a388c5a2991e","observation_id":"f4290753-758c-4db0-b810-38f60de5c556","resolution":{"observed_at":"2026-08-15T20:48:02.247236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.180850Z","title":"Geometric-averaged preference optimization for soft preference labels","venue":null,"work_id":"af751b42-e2f0-43f3-a3eb-3d1c88db9eec","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.959396Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:6ff5e1b22c45e51c4c99a8d7b5bcc6fb83a15deaeaed1dc2a654da945a891b81","observation_id":"7e1630d4-f7ad-49d5-bdd7-30ffd41f5755","resolution":{"observed_at":"2026-08-15T20:48:03.186002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19133","last_updated":"2025-05-30T23:40:44Z","snapshot_observed_at":"2026-08-17T14:09:56.718446Z","submitted_at":"2024-10-24T20:04:15Z","title":"Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19133","snapshot_observed_at":"2026-08-15T20:48:01.963857Z","title":"Hybrid preferences: Learning to route instances for human vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.963857Z"},"links":{"cited_paper":"/paper/2410.19133","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:196c12158f3d6f1ac1e73e33c7543cab5d3b7e0eccb7cad04c992bc25ef2e48b","observation_id":"9489babc-f28a-4ba8-9f63-5fdaf4df6797","resolution":{"observed_at":"2026-08-15T20:48:01.963857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20296","last_updated":"2025-02-24T16:00:16Z","snapshot_observed_at":"2026-08-16T13:14:07.978719Z","submitted_at":"2024-09-30T13:55:42Z","title":"PersonalLLM: Tailoring LLMs to Individual Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20296","snapshot_observed_at":"2026-08-15T20:48:01.968836Z","title":"PersonalLLM: Tailoring LLMs to individual preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.968836Z"},"links":{"cited_paper":"/paper/2409.20296","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:305179d09c798ca32dbd7d135fa18f1c9722f1613ebc40b1833043bae32b656f","observation_id":"ae0386f0-5bc1-4fcc-981f-322624dadc21","resolution":{"observed_at":"2026-08-15T20:48:01.968836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T20:48:01.973467Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.973467Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:2461879c82ef675a6d11001ccb860058618dc139508509bfc8df0185c3a5a1f2","observation_id":"977e5d76-02ea-4199-9eea-5075d5515872","resolution":{"observed_at":"2026-08-15T20:48:01.973467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.165093Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":"95f72a0a-a0c4-4502-afe7-e9ea280b1a22","year":2020},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.978162Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:c9269dd95cdc69262f917f69683f9e55df92c6f2112fd1dd8760373e7429ccda","observation_id":"6b831d82-e439-4a7f-a594-3ffc7e19ef5e","resolution":{"observed_at":"2026-08-15T20:48:03.170230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.150469Z","title":"Llama 3 model card","venue":null,"work_id":"3d525916-a37c-4d79-8109-7896d6d18bce","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.982655Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:389f7d32551f75687b890a29a18881a320569aba495ddd199d282ad22ad47eed","observation_id":"1a43929c-4b10-478c-9bb4-17050343fb79","resolution":{"observed_at":"2026-08-15T20:48:03.155048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-15T20:48:01.987206Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.987206Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b24b96afdaafeff85409a862487d2979be288923d05319e2f49d28645fe8e834","observation_id":"7d242f85-8224-4cb8-b5b5-69003d1fa0bb","resolution":{"observed_at":"2026-08-15T20:48:01.987206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00832","last_updated":"2024-11-01T20:02:32Z","snapshot_observed_at":"2026-08-18T02:49:00.286886Z","submitted_at":"2024-06-02T18:42:57Z","title":"BoNBoN Alignment for Large Language Models and the Sweetness of Best-of-n Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00832","snapshot_observed_at":"2026-08-15T20:48:01.991898Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.991898Z"},"links":{"cited_paper":"/paper/2406.00832","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b1d8c2c6f42604e39233e5d9f1b0cd9c798a06718cf0d8ffcbb31196d8de132d","observation_id":"125a6178-0df6-44a6-8aba-c00ee0216d30","resolution":{"observed_at":"2026-08-15T20:48:01.991898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:01.996627Z","title":"A new measure of rank correlation.Biometrika, 30(1-2):81–93, 1938","venue":null,"work_id":null,"year":1938},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:01.996627Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:59e3280e08f34f666dcfbb5c7f0b36026c06186a10fe15db841172612e1298ed","observation_id":"e4bb9d17-40af-40bb-a3d9-8b1a3eb06701","resolution":{"observed_at":"2026-08-15T20:48:01.996627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.125767Z","title":"Evaluating and inducing personality in pre-trained language models","venue":null,"work_id":"8fdecad6-d1f6-4e4d-a865-a41451542038","year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.001044Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:c28d6a7b0c3813f8ec910bd01f7d991b985e0ae2c6d4f91b3baaf3535aa1db86","observation_id":"0bb58212-792b-4008-9560-0ac9960e6996","resolution":{"observed_at":"2026-08-15T20:48:03.130677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00860","last_updated":"2024-10-30T16:37:50Z","snapshot_observed_at":"2026-08-16T13:04:28.106703Z","submitted_at":"2024-10-30T16:37:50Z","title":"Survey of Cultural Awareness in Language Models: Text and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00860","snapshot_observed_at":"2026-08-15T20:48:02.005763Z","title":"Survey of cultural awareness in language models: Text and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.005763Z"},"links":{"cited_paper":"/paper/2411.00860","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7a9222ca68701b603d323acac2d4b6c6bc3861cba21612aba48eb255cab0d4f3","observation_id":"eab3280e-fed5-450a-a9fd-8f7d7dc2f91d","resolution":{"observed_at":"2026-08-15T20:48:02.005763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08688","last_updated":"2025-04-08T21:11:19Z","snapshot_observed_at":"2026-08-16T12:51:00.482735Z","submitted_at":"2025-03-11T17:59:53Z","title":"Randomness, Not Representation: The Unreliability of Evaluating Cultural Alignment in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08688","snapshot_observed_at":"2026-08-15T20:48:02.010384Z","title":"Randomness, not representation: The unreliability of evaluating cultural alignment in LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.010384Z"},"links":{"cited_paper":"/paper/2503.08688","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:b366e776da62620bed9851b0ba97b6a5235850848018a9cbf2c03cc6b8c7b314","observation_id":"42924a0b-aa6d-49a7-87f2-6afe057c1754","resolution":{"observed_at":"2026-08-15T20:48:02.010384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-15T20:48:02.015013Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.015013Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:a2cf883caf2a22482cce9d89e10dda926981d88329f02cf3ab5afff472e2d92f","observation_id":"219c5de3-053a-42a4-8c06-6472c7dd5526","resolution":{"observed_at":"2026-08-15T20:48:02.015013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.109623Z","title":"¨Uber den variabilit ¨atsbereich der fourier’schen konstanten von positiven harmonischen funktionen.Rendiconti Del Circolo Matematico di Palermo (1884- 1940), 32(1):193–217, 1911","venue":null,"work_id":"c801ca7a-81d5-4497-a34e-b2db19dd3b2c","year":1940},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.020032Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:04244f6999227f249f1f6995b1b9f19b87d33befe78107d1947db0d17d09c2fe","observation_id":"1bca116a-dbfc-47a5-be7d-3a1b2742e3bd","resolution":{"observed_at":"2026-08-15T20:48:03.114625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.095057Z","title":"On the computational complexity of combinatorial problems.Networks, 5(1): 45–68, 1975","venue":null,"work_id":"efce5630-7c86-4fd4-bb7a-b81d0fe79378","year":1975},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.024464Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:e0428328d0e18dedfad6fb4aba9da06ec4d576700b340c348a1616ebba133eac","observation_id":"d4454f1c-08e2-4ab3-9a8c-4e74cd6b6bc0","resolution":{"observed_at":"2026-08-15T20:48:03.099723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.081118Z","title":"Springer, 1988","venue":null,"work_id":"13f850bf-c6df-4629-8683-e182caf02a84","year":1988},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.029040Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:10ae8757d4cafaded6f083e99a28929a06d0ac2403b67c55909bdad7c4683a93","observation_id":"61349d3d-2ccb-49a0-acf2-c57b5db02030","resolution":{"observed_at":"2026-08-15T20:48:03.085389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.033787Z","title":"A theorem on the construction of voting paradoxes.Econometrica: Journal of the Econometric Society, pages 608–610, 1953","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.033787Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7827ed2823d840951dbf1c2b949eed1ad6ef06408b674ac1444e29d55350b476","observation_id":"2b126805-a43a-40c7-bfbf-a4e9d037ac9c","resolution":{"observed_at":"2026-08-15T20:48:02.033787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.056569Z","title":"On the density of families of sets.Journal of Combinatorial Theory, Series A, 13(1):145–147, 1972","venue":null,"work_id":"1844e25c-dae9-465b-9e03-065d702da94c","year":1972},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.038325Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:2c6f5db7a9a20801776d27397807dd8e8bfb5934f7b2e96f752efde35a877c53","observation_id":"e92c2591-2c5b-452f-a0f1-814ff55e3acb","resolution":{"observed_at":"2026-08-15T20:48:03.061482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.042160Z","title":"Cambridge university press, 2014","venue":null,"work_id":"643566f3-405f-41d5-94c4-cdb79a9a299a","year":2014},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.043005Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7f1e0abffdee6aa97dedc4ac63cfe4f81c45399153016855e3a4b41a19306cc6","observation_id":"24962625-be95-4749-989a-69639c7ae85e","resolution":{"observed_at":"2026-08-15T20:48:03.047246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.027750Z","title":"Soap: Improving and stabilizing Shampoo using Adam","venue":null,"work_id":"29b06148-821c-46a7-87d1-a6d8795dec18","year":2025},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.047685Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:240cf3fc06776d65b1e0aafd99aab03efc88a4ca2dd0dbd5e502046141f3be3e","observation_id":"5dea04a9-bb1e-4647-a07c-a150c74e8629","resolution":{"observed_at":"2026-08-15T20:48:03.032510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:03.012696Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"f47cb195-b23b-4b17-83ab-cffbe5168b80","year":2022},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.052292Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:76b574bb38fe7529ff223fc0941facb53dcf0f0fb0f3caa61b1ea7db65eeb248","observation_id":"e2144797-bb48-4d96-9e3c-7fe1258269d2","resolution":{"observed_at":"2026-08-15T20:48:03.017495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.997801Z","title":"Iterative data smoothing: Mitigating reward overfitting and overoptimization in RLHF","venue":null,"work_id":"aa71054e-592c-4692-903c-6a087f013f6a","year":2024},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.056750Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:5a8095dbdb50ee4e98fbe77177f902a61e48b0c84ab3199a7c256b48486450bb","observation_id":"98fe6b40-1563-4a90-aae7-40c68b68f360","resolution":{"observed_at":"2026-08-15T20:48:03.002969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.982511Z","title":"echo chambers,","venue":null,"work_id":"ce71f4b9-6412-4d62-b081-84907919179d","year":2023},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.061114Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:55138471f6112adf760f651ba8fbcc2b529be8e37d6aee461386a277eb0bf1e0","observation_id":"b4386d4c-eca6-4938-8944-e103e636dfe9","resolution":{"observed_at":"2026-08-15T20:48:02.987514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.965937Z","title":"We index xθ by pairsij withi<j , wherexθ ij =1[r θ(yi)≥r θ(yj)]","venue":null,"work_id":"34678024-f928-4b2a-b92e-2074331fae72","year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.065935Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:a984cb7145a1e34f82a2ddb481cfe14292cdac138bd82696b633d84bb680516e","observation_id":"0ee4aab4-3054-40a1-a8ac-84908bf2e539","resolution":{"observed_at":"2026-08-15T20:48:02.971244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.950718Z","title":"disagreement score","venue":null,"work_id":"2bd24f27-d2f8-4f08-a7e1-4460306c141b","year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.070985Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:364643d6390188450dcb4ad8fa84f6e32e7c499d42670a7a0d3b76f272c39f34","observation_id":"5477df53-3d9c-4e1d-82a5-2a8f015b7584","resolution":{"observed_at":"2026-08-15T20:48:02.955553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.936027Z","title":"Fix m points (z1,t 1),...,(z m,tm)","venue":null,"work_id":"9da9bc8e-b3d9-4daf-be7f-d71ee440d26c","year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.076559Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:7025dac68635e47e91e349edbc7cff4a35e10be667718f3cad9d2b5bb09978da","observation_id":"44581390-4dd0-4177-8235-d6a148669929","resolution":{"observed_at":"2026-08-15T20:48:02.940766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.918700Z","title":"IfF 2 pseudo-shatters ((z1,y 1),t 1),...,((z m,ym),tm), thenF 1 pseudo-shatters (z1,t 1−y 1),...,(z m,tm−ym), implying that the pseudo-dimension ofF 2 is at most that ofF 1","venue":null,"work_id":"8af1eb9f-b207-4ab1-8280-0502387f8e9b","year":null},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.081480Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:01bf228a70786baab833f702ba32d8e4e1f862df6e14d2f1581cc885121569d5","observation_id":"a9c24194-7c3e-4518-8801-a976b1ac980b","resolution":{"observed_at":"2026-08-15T20:48:02.924732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:48:02.903276Z","title":"overall” preference. In our experiments, we specifically use the “overall","venue":null,"work_id":"fbe6b4d1-7404-487c-a733-be5f9ab631a1","year":2008},"citing_paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T20:48:02.087057Z"},"links":{"citing_paper":"/paper/2506.06298"},"observation_digest":"sha256:92b15b041d5f8fb9d355584beb2ce10c913ba88bd59e3c68b8a02baeb5d09869","observation_id":"61edd47a-c44e-42a5-aed8-c9fe362532b1","resolution":{"observed_at":"2026-08-15T20:48:02.908571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06298","last_updated":"2025-05-17T18:38:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T17:49:44.775012Z","submitted_at":"2025-05-17T18:38:24Z","title":"Pairwise Calibrated Rewards for Pluralistic Alignment"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":3,"verified_fuzzy":37},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 0 inbound Pith citation observations for arXiv:2506.06298."}