{"as_of":"2026-08-16T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:552ded564047d3918105b40c5fc9aef3ccf2493a29f52dfb4e770a364c6097d6","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:12:52.810257Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:25:22.019686Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T00:07:27.940098Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-08-15T19:25:22.019686Z","title":"Worldpm: Scaling human preference modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16655","last_updated":"2025-06-19T23:57:41Z","snapshot_observed_at":"2026-08-16T10:38:38.919647Z","submitted_at":"2025-06-19T23:57:41Z","title":"Arch-Router: Aligning LLM Routing with Human Preferences","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:25:22.019686Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2506.16655"},"observation_digest":"sha256:02fcacde63f373f6fd7f43e04bffbf24eb6a16668e552187492af9754badf54f","observation_id":"ffe7d007-f520-4ac2-ab6f-069bcd1cb401","resolution":{"observed_at":"2026-08-15T19:25:22.019686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-08-04T20:09:00.504202Z","title":"Worldpm: Scaling human preference modeling.arXiv preprint arXiv:2505.10527, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08826","last_updated":"2025-09-10T17:59:31Z","snapshot_observed_at":"2026-08-08T13:17:31.643163Z","submitted_at":"2025-09-10T17:59:31Z","title":"RewardDance: Reward Scaling in Visual Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:09:00.504202Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2509.08826"},"observation_digest":"sha256:424adee035efa8be36acd16726b60f22cd1c427a7b08cbed69554784407998fb","observation_id":"c6887f61-aa82-4a10-9f0e-16a07b78309b","resolution":{"observed_at":"2026-08-04T20:09:00.504202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-08-02T18:14:49.961366Z","title":"Worldpm: Scaling human preference modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14473","last_updated":"2026-07-15T10:22:14Z","snapshot_observed_at":"2026-08-15T14:42:29.427238Z","submitted_at":"2026-03-15T16:31:51Z","title":"AI Can Learn Scientific Taste","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:14:49.961366Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2603.14473"},"observation_digest":"sha256:352b90e0d9386a09be96311e9077cfda08602eae7ec44d086c108f302d354fce","observation_id":"f423c084-1aae-4047-82a9-ee19963d9dc0","resolution":{"observed_at":"2026-08-02T18:14:49.961366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":"2505.10527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-07-03T00:07:27.940098Z","title":"Worldpm: Scaling human preference modeling","venue":null,"work_id":"bc1f5d9c-1e8f-4f68-a2d0-6a4456d5531a","year":2025},"citing_paper":{"arxiv_id":"2604.17188","last_updated":"2026-04-28T11:56:12Z","snapshot_observed_at":"2026-08-13T10:16:45.904205Z","submitted_at":"2026-04-19T01:27:41Z","title":"Beyond Overlap Metrics: Rewarding Reasoning and Preferences for Faithful Multi-Role Dialogue Summarization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T06:47:34.623340Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2604.17188"},"observation_digest":"sha256:331f6b0d9e116bcae96b463de5262339a8df0ed59a843d0227a7285df3c9581b","observation_id":"c7f984f2-8052-45cb-abbe-747d8cfe1a63","resolution":{"observed_at":"2026-05-10T06:51:46.328497Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":"2505.10527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-07-03T00:07:27.940098Z","title":"Worldpm: Scaling human preference modeling","venue":null,"work_id":"bc1f5d9c-1e8f-4f68-a2d0-6a4456d5531a","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-08-14T02:06:16.181569Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-07T08:00:33.307429Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:a74ca3362fb62f5b2878ac96dc53e5a029809e572add91b1efe7d82f5b029a15","observation_id":"d8ebd339-9560-40c2-9808-0fb0e0b52c20","resolution":{"observed_at":"2026-05-12T10:06:27.446483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":"2505.10527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-07-03T00:07:27.940098Z","title":"Worldpm: Scaling human preference modeling","venue":null,"work_id":"bc1f5d9c-1e8f-4f68-a2d0-6a4456d5531a","year":2025},"citing_paper":{"arxiv_id":"2604.27505","last_updated":"2026-05-20T07:08:10Z","snapshot_observed_at":"2026-08-14T02:06:16.181569Z","submitted_at":"2026-04-30T06:54:39Z","title":"Leveraging Verifier-Based Reinforcement Learning in Image Editing","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T09:11:02.183133Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2604.27505"},"observation_digest":"sha256:82bb4ba2d415e2a1ed649fa5c3f2e6ead07e5e05fcfab9eae5445a9561efcd66","observation_id":"b54261bb-8481-4f67-9bc9-04a6944e3572","resolution":{"observed_at":"2026-05-21T09:14:05.932676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":"2505.10527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-07-03T00:07:27.940098Z","title":"Worldpm: Scaling human preference modeling","venue":null,"work_id":"bc1f5d9c-1e8f-4f68-a2d0-6a4456d5531a","year":2025},"citing_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:05:25.567581Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2605.08703"},"observation_digest":"sha256:a28fd7e11cec66af8e4c668aa117db0278b3538f05faf7423598f957dffa1de1","observation_id":"2619ad0c-fc3c-45c9-8374-4ed6ab95b580","resolution":{"observed_at":"2026-05-12T08:31:23.995255Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":"2505.10527","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-07-03T00:07:27.940098Z","title":"Worldpm: Scaling human preference modeling","venue":null,"work_id":"bc1f5d9c-1e8f-4f68-a2d0-6a4456d5531a","year":2025},"citing_paper":{"arxiv_id":"2606.09076","last_updated":"2026-07-14T12:46:55Z","snapshot_observed_at":"2026-08-16T00:39:17.618423Z","submitted_at":"2026-06-08T06:20:12Z","title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:57.001021Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2606.09076"},"observation_digest":"sha256:24c2ad0f4e9d3aa7365df460b84dae1a647decf1581239065cc7affbed05f263","observation_id":"7808e38c-29ba-4e74-a93b-4aad4a8ebd20","resolution":{"observed_at":"2026-07-03T00:07:27.941638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-07-15T10:53:37.186361Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.09076","last_updated":"2026-07-14T12:46:55Z","snapshot_observed_at":"2026-08-16T00:39:17.618423Z","submitted_at":"2026-06-08T06:20:12Z","title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-15T10:53:37.186361Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2606.09076"},"observation_digest":"sha256:75fddd075d42913eed707c0da3c27dba0edf4fe54abb3c1a3ee250d723b91671","observation_id":"2d25d118-c7e0-45f1-8ef5-4658c4a9af16","resolution":{"observed_at":"2026-07-15T10:53:37.186361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10527","snapshot_observed_at":"2026-08-07T05:49:45.723481Z","title":"arXiv preprint arXiv:2505.10527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06310","last_updated":"2026-08-06T17:24:36Z","snapshot_observed_at":"2026-08-16T14:34:11.535533Z","submitted_at":"2026-08-06T17:24:36Z","title":"RRC: Unlocking Generative Reward Models in LLM Reinforcement Learning via Ranking-Based Reward Construction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:49:45.723481Z"},"links":{"cited_paper":"/paper/2505.10527","citing_paper":"/paper/2608.06310"},"observation_digest":"sha256:3f829f6effcf0dcbe8ae09ec617e4699179bbfc6344d7f5835786c7523e67604","observation_id":"e834e349-dfe1-4c35-b6a7-699bc4d1b514","resolution":{"observed_at":"2026-08-07T05:49:45.723481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.10527/citation-record","integrity":"/paper/2505.10527/integrity","json":"/paper/2505.10527/citation-record.json","paper":"/paper/2505.10527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-15T21:12:52.478426Z","title":"Brown, Jack Clark, Sam McCandlish, Christopher Olah, and Jared Kaplan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.478426Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:241336556fb043701aca5f11232f3a919bad8291e9ae8ba8bd9823d1c6e086c5","observation_id":"dd4945dd-82cb-492c-9114-082e1378e27d","resolution":{"observed_at":"2026-08-15T21:12:52.478426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-15T21:12:52.485232Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.485232Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:ef15caf549572e07f9b410287d2c7a68e6f91c9dd188a80eeaeeba5510dbeac0","observation_id":"7fe14baf-8470-46ee-82a7-111fb8396b34","resolution":{"observed_at":"2026-08-15T21:12:52.485232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T21:12:52.491148Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.491148Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:aca4bd11392749397304dc0a7a0372c5d96f81f85089c4af000973c8ed04aaed","observation_id":"038d8ad6-2151-455d-86af-2d48750a302f","resolution":{"observed_at":"2026-08-15T21:12:52.491148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T21:12:52.497498Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.497498Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:d3b652b7980ee65c15d3d424432ec9b7247cbd70ac679bf80412e41af51eee9a","observation_id":"78d59d92-fe07-4506-a9a3-316ac83f7753","resolution":{"observed_at":"2026-08-15T21:12:52.497498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T21:12:52.503000Z","title":"Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.503000Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:c88caf955cba29ce083ffa2adceeec200aeabe27ae673bab348683e1cd5d87c0","observation_id":"e4ab421e-f427-409a-b4c2-39ffd8ef1452","resolution":{"observed_at":"2026-08-15T21:12:52.503000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.508807Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.508807Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:56d2fe5dbbd03db2758fe6c8e8eef11746dcce432506147c0c1db5aaf315391e","observation_id":"d18cef2f-043a-4af2-aeb4-2142cd93b39f","resolution":{"observed_at":"2026-08-15T21:12:52.508807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-15T21:12:52.518084Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.518084Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:315985bf5d61b33abd4da5b5c466baa5d1d97eb728310c70e4758956b0f691e9","observation_id":"c15523b1-4a19-4dcf-a6f0-b574cf8f1a8c","resolution":{"observed_at":"2026-08-15T21:12:52.518084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.527786Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.527786Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:7c86cf40376204c2419f7492807d9c9249dea99930010380bfeef2abfbed47b2","observation_id":"8b407869-0a74-468d-ad8a-03bf4a5f4c32","resolution":{"observed_at":"2026-08-15T21:12:52.527786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-16T14:55:10.453487Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-15T21:12:52.537302Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.537302Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:15695a486a2b470d565e21d071df0db9d193146cc786e60e8cd51e905705c1b7","observation_id":"a2cca691-02e8-4761-a1bc-2e5f04746e33","resolution":{"observed_at":"2026-08-15T21:12:52.537302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:53.987263Z","title":"Cram \\'e r","venue":null,"work_id":"7246ae49-192d-441c-b69d-2ca4b20f0830","year":1946},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.542032Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:dadda2f239785079cd3f194b19c13cb73f250299e88355afddd797d531e4891c","observation_id":"2c8dfd03-b2c8-42ba-9770-a3af028f6b7f","resolution":{"observed_at":"2026-08-15T21:12:53.994356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-15T21:12:52.554517Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.554517Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:30d1cc7edbdbff6c413c01b382041d0151872275a0292b9103fb6a4daa069eaf","observation_id":"9e2dc8e8-9bd6-42ee-b1f0-a45a48687731","resolution":{"observed_at":"2026-08-15T21:12:52.554517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:12:52.559605Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.559605Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:1a8361bd7ab9e8df9aad1ec78f7318092e2e76e7f8848390e72ec7907cc01652","observation_id":"25581d1d-a1c4-44d6-bdf1-a56e93872eb4","resolution":{"observed_at":"2026-08-15T21:12:52.559605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-15T21:12:52.565755Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.565755Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:3bcd5ac5451945ac3c14d88fff5228bea8fc6413d1af6a7df35c571c77a8231f","observation_id":"f5c2e0d6-c2b0-4cdd-81e0-35e196432e1a","resolution":{"observed_at":"2026-08-15T21:12:52.565755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:53.970055Z","title":"Networks, crowds, and markets: Reasoning about a highly connected world, volume 1","venue":null,"work_id":"52a5b8b2-8d5c-4d87-86d3-716a11520c4d","year":2010},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.570501Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:374fbb7f3dce97d4df9b7a23d47f1106524de3e8bf08b7a25736677e528a0297","observation_id":"a9edae22-3c0b-46a6-8a2f-6bcc74c1bbb9","resolution":{"observed_at":"2026-08-15T21:12:53.974825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15268","last_updated":"2025-01-27T11:35:04Z","snapshot_observed_at":"2026-08-16T13:16:09.314044Z","submitted_at":"2024-09-23T17:58:07Z","title":"Style Outweighs Substance: Failure Modes of LLM Judges in Alignment Benchmarking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15268","snapshot_observed_at":"2026-08-15T21:12:52.576766Z","title":"Dickerson","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.576766Z"},"links":{"cited_paper":"/paper/2409.15268","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:46d5026e571bc7c51aa008d67ce6e3867a175a9e6590727a7ae3e84ccbd93869","observation_id":"a1e8dd68-4f2c-469a-9845-439d8b3b5b15","resolution":{"observed_at":"2026-08-15T21:12:52.576766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.583615Z","title":"Athene-70b: Redefining the boundaries of post-training for open models, July 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.583615Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:26d49e30a253bc6ec2e0643bb7f43ea2d249f7309bc577fa1bef6c51e4207b8d","observation_id":"56419043-d0e3-4983-ad43-cebbd94833a0","resolution":{"observed_at":"2026-08-15T21:12:52.583615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14872","last_updated":"2024-10-22T22:18:14Z","snapshot_observed_at":"2026-08-16T13:07:53.900096Z","submitted_at":"2024-10-18T21:38:21Z","title":"How to Evaluate Reward Models for RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14872","snapshot_observed_at":"2026-08-15T21:12:52.589817Z","title":"How to evaluate reward models for rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.589817Z"},"links":{"cited_paper":"/paper/2410.14872","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:8d8de02ad78e986eb99c0beaebd288b972988a3c03e6d68fb03ee3062cff62a3","observation_id":"246eac89-1703-458f-8d1c-c5afa4793d67","resolution":{"observed_at":"2026-08-15T21:12:52.589817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.599159Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.599159Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:a1464973cc2542808c6cdf678c2f948fd9cf5b1f341d8ca84608b569e1277c37","observation_id":"64056f1d-7309-43b0-bd39-97293d856249","resolution":{"observed_at":"2026-08-15T21:12:52.599159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:53.915361Z","title":"Zemel, Wieland Brendel, Matthias Bethge, and Felix Wichmann","venue":null,"work_id":"5959d983-a2d6-4f9e-a4f7-dc579e9bbceb","year":2020},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.608497Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:42a2b6d974040c5bdf88a47d1262469cd807e8b7b515b73d2e00d3274a126e4e","observation_id":"a1a25115-ff8c-4727-84fa-310136e56e9e","resolution":{"observed_at":"2026-08-15T21:12:53.922923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T21:12:52.615710Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.615710Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:d23d02c3b5af95bec7cb888bc9e2ce8e1ba09f7cf110c5a192344ee4ddd4f3f3","observation_id":"60c429d7-0e1b-476c-9833-a885d173e835","resolution":{"observed_at":"2026-08-15T21:12:52.615710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08315","last_updated":"2022-11-20T23:43:56Z","snapshot_observed_at":"2026-08-13T19:38:28.893815Z","submitted_at":"2021-04-16T18:57:19Z","title":"Surface Form Competition: Why the Highest Probability Answer Isn't Always Right","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08315","snapshot_observed_at":"2026-08-15T21:12:52.625178Z","title":"Surface form competition: Why the highest probability answer isn’t always right","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.625178Z"},"links":{"cited_paper":"/paper/2104.08315","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:5f63738faa8374f78504b0fd55d5921991b9cc94ee8ede2fdffedf98181bce46","observation_id":"c3d2ec17-2845-421d-8bef-be598663dc91","resolution":{"observed_at":"2026-08-15T21:12:52.625178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:53.885887Z","title":"Collaborative filtering for implicit feedback datasets","venue":null,"work_id":"74f73d54-345f-4fe0-812e-555202270a6c","year":2008},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.631146Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:dd3167dcd340f683d5f34951be8b4a571ad62f074316c233c6aad544659093e7","observation_id":"e9b9f065-fc85-4afb-a579-b93c7823b9f4","resolution":{"observed_at":"2026-08-15T21:12:53.894272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09279","last_updated":"2024-10-07T21:24:59Z","snapshot_observed_at":"2026-08-16T13:43:16.212350Z","submitted_at":"2024-06-13T16:17:21Z","title":"Unpacking DPO and PPO: Disentangling Best Practices for Learning from Preference Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09279","snapshot_observed_at":"2026-08-15T21:12:52.638694Z","title":"Unpacking dpo and ppo: Disentangling best practices for learning from preference feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.638694Z"},"links":{"cited_paper":"/paper/2406.09279","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:996cb2d914dc217dbae2d1bec755992c404d620bdb20ca663075203902ea261b","observation_id":"6caf8d8f-3628-4ef2-8257-9cd018587043","resolution":{"observed_at":"2026-08-15T21:12:52.638694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-15T21:12:52.645824Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeff Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.645824Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:5016ef55190247a2c47a0a06f9795b15e9fe35b1f1db024cbb51602364c59e99","observation_id":"e2e0d544-b10c-42bb-8697-0bb6cdb470f1","resolution":{"observed_at":"2026-08-15T21:12:52.645824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.651832Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.651832Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:e19a53f7ee4500f2cf68e8d444cc1574aa739e56fd017bc9a36e5ebed34e689e","observation_id":"37859d0e-2136-4685-83c0-50360ea94db8","resolution":{"observed_at":"2026-08-15T21:12:52.651832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:53.843325Z","title":"Rlaif vs","venue":null,"work_id":"3436ab24-d0e8-45e8-b44a-67638bc22623","year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.656679Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:9404a9dd2a2da390f526bcd8b4bb5ae47ae9d2ffa68efc901d280da85f2b305e","observation_id":"1dc354db-4daf-4c07-b070-3bed702d1ab3","resolution":{"observed_at":"2026-08-15T21:12:53.859118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.662907Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.662907Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:c18201bda88aaa467f1a1dc42adf64410242a419f55c0976525dd8f499a45504","observation_id":"00b5977d-921c-4773-ab1c-d00d38674d54","resolution":{"observed_at":"2026-08-15T21:12:52.662907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-16T14:51:42.615061Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-15T21:12:52.668743Z","title":"Remax: A simple, effective, and efficient method for aligning large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.668743Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:c7b7f511e555f81aea528c1bfa921ea97262e81c9d78a60371968d9b64ef9ec1","observation_id":"158002a8-73d6-4172-9fd1-c2b51571f46c","resolution":{"observed_at":"2026-08-15T21:12:52.668743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16184","last_updated":"2024-10-21T16:48:26Z","snapshot_observed_at":"2026-08-16T13:07:19.377465Z","submitted_at":"2024-10-21T16:48:26Z","title":"RM-Bench: Benchmarking Reward Models of Language Models with Subtlety and Style","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16184","snapshot_observed_at":"2026-08-15T21:12:52.675541Z","title":"Rm-bench: Benchmarking reward models of language models with subtlety and style","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.675541Z"},"links":{"cited_paper":"/paper/2410.16184","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:3293895d981a41e21f0a1e338a961fd3228366cee58efb7860983768af791a6c","observation_id":"01faa9ca-2b6a-43f3-b60a-92979cf005ca","resolution":{"observed_at":"2026-08-15T21:12:52.675541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07124","last_updated":"2024-02-18T09:46:06Z","snapshot_observed_at":"2026-08-16T15:08:39.154570Z","submitted_at":"2023-08-14T13:53:54Z","title":"OctoPack: Instruction Tuning Code Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07124","snapshot_observed_at":"2026-08-15T21:12:52.681472Z","title":"Octopack: Instruction tuning code large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.681472Z"},"links":{"cited_paper":"/paper/2308.07124","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:b49b6e490fd222233458fdd81baea57458d4a6b2b9336d3e75512ee3d5c68ab1","observation_id":"9fd180ff-098e-42b7-a39c-3b787a326217","resolution":{"observed_at":"2026-08-15T21:12:52.681472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.688122Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.688122Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:24a00a53d5991900cf97b4cb7fdfd00148bd91e33ba87c76a07e713238e70cee","observation_id":"7d186b9f-d975-4f0a-8f43-6bebc313e223","resolution":{"observed_at":"2026-08-15T21:12:52.688122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:53.782155Z","title":"Maxwell Harper, and Joseph A","venue":null,"work_id":"e34ac9c0-4e05-4904-a476-2d515c394766","year":2012},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.694991Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:04215517726840556bfdb1af5115e32207273fd4b9eb6a4e04662b2fc885903e","observation_id":"d62c5174-d338-49de-b53a-c6df2d7b9478","resolution":{"observed_at":"2026-08-15T21:12:53.788178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-16T13:35:55.424658Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-15T21:12:52.701060Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.701060Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:bdf32659113b8c767144e96c3b5e9ff90754076fd5004ad4488ec939cc18c627","observation_id":"c0978775-496a-4fb0-932b-a78846273445","resolution":{"observed_at":"2026-08-15T21:12:52.701060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-15T21:12:52.705495Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.705495Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:8c13ba26e4a1e5bb21b567e0e201ca620719f8cf06a39a95758da32478ede261","observation_id":"bb293d53-4df8-4b20-9de1-5c0af81d3f49","resolution":{"observed_at":"2026-08-15T21:12:52.705495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T21:12:52.712234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.712234Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:13c61f0322653a19b5464c3fff048d3f84846ff78246caa300a5d30db41fbfc1","observation_id":"ad4e9b09-21d8-48c5-9413-65c7648b1373","resolution":{"observed_at":"2026-08-15T21:12:52.712234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.717933Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.717933Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:b6f8a8b110153a723c82262ab31e744f6455943d9862be0bcef8e0960bc5f59a","observation_id":"3e3d2f2f-2adb-418a-816b-b262f2d578a9","resolution":{"observed_at":"2026-08-15T21:12:52.717933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-08-16T13:01:59.544332Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-15T21:12:52.721989Z","title":"Rethinking bradley-terry models in preference-based reward modeling: Foundations, theory, and alternatives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.721989Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:f7ceda8cb1b999ce07ad2813220d6c4fb2d97558bef97bf3fc2815d7a15f9b9b","observation_id":"46458c3d-2c32-4ca9-b8fb-52607b01e985","resolution":{"observed_at":"2026-08-15T21:12:52.721989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.727248Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.727248Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:36e5070abf1e082f8681352bcc394e639c9e92674e0c2510ba68864fbd5710ac","observation_id":"6a5b55ef-5e5e-4d10-8554-cb69fc0a421b","resolution":{"observed_at":"2026-08-15T21:12:52.727248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-15T21:12:52.731295Z","title":"Ku, Kai Wang, Alex Zhuang, Rongqi \"Richard\" Fan, Xiang Yue, and Wenhu Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.731295Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:d1a5d97e3bfddc81b9e13d193328c4b116c23b2799c7fdd6d2ce37341af46b79","observation_id":"41abadb6-c16f-48de-b069-8cef397bfd3d","resolution":{"observed_at":"2026-08-15T21:12:52.731295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-16T13:43:33.392971Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-15T21:12:52.735907Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.735907Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:7aa83ec75751829bca61dcec6ab99c8ab1bb840984d4d9e44f3f887b3e8841e4","observation_id":"caed08d2-caed-4eec-b14c-a38746b092d5","resolution":{"observed_at":"2026-08-15T21:12:52.735907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-15T21:12:52.741291Z","title":"Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.741291Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:700351a9b7f24210e17791dad462661f46f76b21e4c6def38f8d91316503975d","observation_id":"0d4ad2b1-874d-4be8-a21c-f2565d598da1","resolution":{"observed_at":"2026-08-15T21:12:52.741291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-08-16T14:00:26.360262Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-15T21:12:52.746392Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.746392Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:308b2885975278f400b3b0b1d5ba320741158f87dd3ff2927736d631478a602c","observation_id":"01a55ba0-bc37-4935-808b-11092538745d","resolution":{"observed_at":"2026-08-15T21:12:52.746392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T21:12:52.751105Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.751105Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:f8cd35cb5ec14dfd90be569f15927c041a65e1ac033461c23cfdd949278d1c33","observation_id":"f256540d-e209-442c-9c08-be02850d0fe1","resolution":{"observed_at":"2026-08-15T21:12:52.751105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T21:12:52.755325Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.755325Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:ee9aa7e2b9aadccf611d8c2c21f75aeaf26be3c5ad016126a211b5d45e2479c7","observation_id":"ad59b7f5-6717-460b-8795-56c05bbad3ca","resolution":{"observed_at":"2026-08-15T21:12:52.755325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.759300Z","title":"Evaluating large language models at evaluating instruction following","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.759300Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:97c84b5ce25ba2a2fccc45583bf4bdbe01ab520cde7cec20cf7c0051cf60d07e","observation_id":"26e9dce5-c17c-4dce-b01d-3cb7d9ee180b","resolution":{"observed_at":"2026-08-15T21:12:52.759300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.03530","last_updated":"2017-02-26T19:36:40Z","snapshot_observed_at":"2026-08-01T16:56:59.989486Z","submitted_at":"2016-11-10T22:02:36Z","title":"Understanding deep learning requires rethinking generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.03530","snapshot_observed_at":"2026-08-15T21:12:52.763514Z","title":"Understanding deep learning requires rethinking generalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.763514Z"},"links":{"cited_paper":"/paper/1611.03530","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:e46504ade3bae8230eb56c738ea88049c3b026a63fe36d081e2dce709472dc77","observation_id":"3094a929-2a9b-4494-ae38-dc2201a933f1","resolution":{"observed_at":"2026-08-15T21:12:52.763514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-15T21:12:52.769528Z","title":"Xing, Haotong Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.769528Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:4f97d0bf4bd776847ea4cb63d2f9ec52828b3f4d4819c56c2a7d843ef6cce7c0","observation_id":"1ae01066-6b79-480c-b369-c48cf36c3d1e","resolution":{"observed_at":"2026-08-15T21:12:52.769528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-16T10:37:13.463130Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-15T21:12:52.776891Z","title":"Secrets of rlhf in large language models part i: Ppo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.776891Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:0e4bc7f3b38f417ef269db0025db1325ba6e40fc2b8e9c9e04a9e4ec843fef77","observation_id":"27dd7f08-22fb-434a-a112-2a496e1054c5","resolution":{"observed_at":"2026-08-15T21:12:52.776891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09893","last_updated":"2025-04-04T11:45:02Z","snapshot_observed_at":"2026-08-16T13:09:53.449886Z","submitted_at":"2024-10-13T16:06:54Z","title":"RMB: Comprehensively Benchmarking Reward Models in LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09893","snapshot_observed_at":"2026-08-15T21:12:52.781845Z","title":"Rmb: Comprehensively benchmarking reward models in llm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.781845Z"},"links":{"cited_paper":"/paper/2410.09893","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:2fc98d8fdca4ee6f3e10e119babd3e7c225e0a0d706417e730a8ca5c935d5f13","observation_id":"475d6f77-da7c-453e-975c-47bc36c51078","resolution":{"observed_at":"2026-08-15T21:12:52.781845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T21:12:52.789452Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.789452Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:c091aa32e7586874ad4f518c362d2cb2b3466acb836c1911cf86940c0a9dd30f","observation_id":"234cd9c5-2b91-4154-b177-b17023842e3e","resolution":{"observed_at":"2026-08-15T21:12:52.789452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.794824Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.794824Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:188d9ae4d53295ef2bb1882639d5aa3b0b64881f1367bace0f1078f9a5f0e5a0","observation_id":"a8678d4c-cfa5-494a-bfed-fd0f8a36e948","resolution":{"observed_at":"2026-08-15T21:12:52.794824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.800078Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.800078Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:2dc9f5e4f9351b6fa364a7d7a234eccb8ba5207e900e8a609be9c4d91dd06a93","observation_id":"6b40fdb6-cf0b-46c9-bb56-43258e14e66d","resolution":{"observed_at":"2026-08-15T21:12:52.800078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:52.805530Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.805530Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:fa7bf9712e54fe6956b9031d833c5af746d3a3f132dff5cccae53fbe2d83dfe5","observation_id":"e0420f27-bb26-4d8c-8baa-85f4abc1d253","resolution":{"observed_at":"2026-08-15T21:12:52.805530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:12:53.510573Z","title":"D sRGB DeXIfMM* i ͠ u @IDATx ]7 1ϳP<桔c iu0jP3","venue":null,"work_id":"32c28230-2068-417d-8649-043a3cd4f18d","year":null},"citing_paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T21:12:52.810257Z"},"links":{"citing_paper":"/paper/2505.10527"},"observation_digest":"sha256:cd05bddc047cacd0e2f517edbf65187147b985000356ef9521719f07ba5cb773","observation_id":"187be880-bd1c-40ca-90cd-1d02e2f9bfb0","resolution":{"observed_at":"2026-08-15T21:12:53.517275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.10527","last_updated":"2025-05-18T17:45:31Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T10:37:57.311880Z","submitted_at":"2025-05-15T17:38:37Z","title":"WorldPM: Scaling Human Preference Modeling"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 10 inbound Pith citation observations for arXiv:2505.10527."}