{"as_of":"2026-08-10T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e01898920077efd16a38bfffa35fd9147287b6247511570c5d85f9525708b77c","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:49.168492Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23247/citation-record","integrity":"/paper/2505.23247/integrity","json":"/paper/2505.23247/citation-record.json","paper":"/paper/2505.23247"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:59:44.286507Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.286507Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:9b91e86e9bece6492c6b03ee191cc94daeaebf797d052aeb6a86747c7f20f670","observation_id":"77bbfb63-640e-41ac-880e-8354745ec0f1","resolution":{"observed_at":"2026-08-07T12:59:44.286507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T12:59:44.338823Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.338823Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:a85d4ae819725fa4d1b86ed259a1c7766076877001df85f16ee0017f46742b0b","observation_id":"5cd1c3b0-8545-40f8-9e76-ab1e7b05cc95","resolution":{"observed_at":"2026-08-07T12:59:44.338823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.836516Z","title":"Biderman, H","venue":null,"work_id":"dfb7b527-fc03-49d8-b1bd-a68c158e4469","year":2023},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.398065Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:49aece06e93b48b2b5cb564a870b762ecbc1924e4f112a17fd0bd3858221b7d2","observation_id":"5df03760-eb3a-4895-bc6e-e7617d7c849e","resolution":{"observed_at":"2026-08-07T12:59:52.930185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T12:59:44.493191Z","title":"Bommasani, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.493191Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:93075ddb41f532e55906acf2671af57d8aec863930e2a6b81377c78dbb917233","observation_id":"009e307f-77ea-4bc4-b906-2638e8a9c2b4","resolution":{"observed_at":"2026-08-07T12:59:44.493191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.621795Z","title":"Brown, B","venue":null,"work_id":"2449dde7-308e-499c-ba9b-4c5b5f4cd66d","year":2020},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.558034Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:c002a4e53ac47dc44cfad4c2915eeb44bb2d6acc18d0cbbffbc86d18071393c2","observation_id":"873fd355-ecdc-4e96-bc55-42f8314b04fd","resolution":{"observed_at":"2026-08-07T12:59:52.702380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.402564Z","title":"Busa-Fekete, B","venue":null,"work_id":"bd05d876-2f08-4b93-993b-dced04aa906a","year":2014},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.669918Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:027c408bcce2350e80769a86d061a7782314580e7fe51b1b3c2d9bf9c9cfd60c","observation_id":"478a1110-21f8-48ec-80f5-02d5da0601ff","resolution":{"observed_at":"2026-08-07T12:59:52.492367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06554","last_updated":"2024-10-16T04:48:08Z","snapshot_observed_at":"2026-08-05T02:22:02.033882Z","submitted_at":"2024-10-09T05:17:08Z","title":"The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models","version":2},"cited_work":{"arxiv_id":"2410.06554","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06554","snapshot_observed_at":"2026-08-07T12:59:49.985066Z","title":"The Accuracy Paradox in RLHF: When Better Reward Models Don't Yield Better Language Models","venue":"cs.CL","work_id":"0af7f164-fe8a-4e06-bb3e-ec54a273a35d","year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.776384Z"},"links":{"cited_paper":"/paper/2410.06554","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:832e98aafb2eb1c73bb316bafeab3f371c6b2a4e3323e968acefcff9d1edf94e","observation_id":"c28f5f59-6cf7-43b9-96d3-637382b39030","resolution":{"observed_at":"2026-08-07T12:59:50.084647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.259163Z","title":null,"venue":null,"work_id":"3c2dd54d-161d-49ee-bf99-2c132eeecf73","year":2017},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.880939Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:2d0726c51e0012fe52a373ec38f4ce36c268bf6b0bd4196c533becab2ad48867","observation_id":"54bf522b-4f9c-4680-a28f-706e37191467","resolution":{"observed_at":"2026-08-07T12:59:52.339589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:52.081034Z","title":"Chujie, S","venue":null,"work_id":"aff063e2-9808-4287-ba35-40931216e38a","year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:44.987046Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:b13c4fb02fca28502966a24568289811c28d3dd434c8ffbd0c1ae0bd1774e97f","observation_id":"c363396a-0a42-4644-b8a4-9fe8775af82d","resolution":{"observed_at":"2026-08-07T12:59:52.201484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.913823Z","title":null,"venue":null,"work_id":"f0eac068-55f0-4230-a69a-11177ab42000","year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:45.089926Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:a23cab81dfc6248e7ac5ad5d1bbf7bf4de0bdeaaa21d88c745eeac29f2c0a04c","observation_id":"b97eb7be-0ff2-497d-988d-50a8efd04ff0","resolution":{"observed_at":"2026-08-07T12:59:51.988803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.690695Z","title":null,"venue":null,"work_id":"630498e1-ee96-4b98-9c94-a96739adf0b9","year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:45.227730Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:0f070ecd5de0e63474bf879a37288125592a7296d829548ced1c8c02c7cb8b68","observation_id":"87614c65-c5fd-4e18-bdb3-896c4ca1e193","resolution":{"observed_at":"2026-08-07T12:59:51.807241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.437568Z","title":null,"venue":null,"work_id":"bc00c880-f799-4672-9574-cfc1aa955f1d","year":2023},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:45.334159Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:14b02850b57775da684ab8e98c8635c1865f965c35bc05e1d19581d5f6d158eb","observation_id":"997c44ba-346c-42fc-858a-3666c5699c72","resolution":{"observed_at":"2026-08-07T12:59:51.534506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.280891Z","title":"Gr¨unbaum, V","venue":null,"work_id":"66529495-6350-4d67-990b-35f1fa20f47b","year":1967},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:45.466150Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:a4d2e0ed7d3d1a00f8744052bbe3207b8bd3e354a2cb3a4ddb3452ee900ef050","observation_id":"b1a7a1bb-a0c5-47c3-ae39-46bc7d4c07d0","resolution":{"observed_at":"2026-08-07T12:59:51.371181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T12:59:45.553164Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:45.553164Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:cc8d8ffe88d926ceeb2efae4aac585b4ce8c426d8ea03df2ee7bb60830e75cc4","observation_id":"e13f9c7f-146b-428b-ae70-b1175beb77b0","resolution":{"observed_at":"2026-08-07T12:59:45.553164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17814","last_updated":"2025-02-25T03:40:36Z","snapshot_observed_at":"2026-08-07T17:51:23.755026Z","submitted_at":"2025-02-25T03:40:36Z","title":"An Overview of Large Language Models for Statisticians","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17814","snapshot_observed_at":"2026-08-07T12:59:45.680041Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:45.680041Z"},"links":{"cited_paper":"/paper/2502.17814","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:88b5842713f0efd52970548df780c15a1e627e4fd8d45646a4902f16a552c4af","observation_id":"61f26049-22d0-4e45-9147-e926ac8b41d2","resolution":{"observed_at":"2026-08-07T12:59:45.680041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-07T12:59:45.856856Z","title":"Lambert, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:45.856856Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:1ff35a2987cd85660779a04f691d9fee280e533157e2be3cdb6f7ad71221d499","observation_id":"38fc1af3-733a-47dc-80a4-1c3105557b5d","resolution":{"observed_at":"2026-08-07T12:59:45.856856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:45.973358Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:45.973358Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:e93f484c3e6ba876754ebdacab2421eeb94e24b066a6758fb6c5c3e4e6002161","observation_id":"d7a1ad49-e044-4c75-b602-64ebd181ce73","resolution":{"observed_at":"2026-08-07T12:59:45.973358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T12:59:46.078140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.078140Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:2ab037d4045aa4760bc695456f958adbdb1ced0bd198633420f179ca95aca2ad","observation_id":"703955ed-8188-4880-bbc3-5b459386055e","resolution":{"observed_at":"2026-08-07T12:59:46.078140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07282","last_updated":"2024-02-13T14:21:02Z","snapshot_observed_at":"2026-08-09T06:57:58.851102Z","submitted_at":"2024-02-11T19:13:26Z","title":"How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07282","snapshot_observed_at":"2026-08-07T12:59:46.192236Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.192236Z"},"links":{"cited_paper":"/paper/2402.07282","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:98df69400420d91a1f967b1ff3761c49316f585cde92b6657d3a7a609b86d2f8","observation_id":"51262a20-3615-4009-b319-8df2320193ab","resolution":{"observed_at":"2026-08-07T12:59:46.192236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T12:59:46.332920Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.332920Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:04a89914dc0fc9c0de251e760a6fa7c2447d8e84df986c2a4b5293b8cdba8e8c","observation_id":"2a18dfff-a744-402e-a18a-80706f1dd73e","resolution":{"observed_at":"2026-08-07T12:59:46.332920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:51.098250Z","title":"Ouyang, J","venue":null,"work_id":"c2a7af06-0bdc-4e1d-a992-d6cb7cea77a5","year":2022},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.436502Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:ba6341dfa3023483129925a1354696eeaf0cafa67c54a3f4bca73af39dff9c05","observation_id":"3b06221c-1394-4095-9e18-8c0c2f95f4fd","resolution":{"observed_at":"2026-08-07T12:59:51.205344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:50.869476Z","title":"Radford, K","venue":null,"work_id":"ef64ae2d-c650-427d-aa36-7e958b98ad06","year":2018},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.506583Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:756ee25ab8ed799c7dc8b43b5bb862bb2e2cc33c7ab3f2641986801a7df030fa","observation_id":"64e7dd7c-78dd-4bae-8327-e00e335e3915","resolution":{"observed_at":"2026-08-07T12:59:50.956294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:50.724117Z","title":"Rafailov, A","venue":null,"work_id":"184875a2-862e-4406-bdd4-8ae68a1df94a","year":2023},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.639735Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:06dec6a8d31c9f83a1c1a55d9f2a883a6d0a60c58d84c5531858a6eb298452c8","observation_id":"75223c18-a2d3-4934-943e-de025d093d7c","resolution":{"observed_at":"2026-08-07T12:59:50.800422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:46.741897Z","title":"Razin, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.741897Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:ca3f1444731ceeacec2b67ccf714dd05e72d75d571989cc35f8188bc8cf707ec","observation_id":"cfbcce77-e685-4005-8254-0f9945216123","resolution":{"observed_at":"2026-08-07T12:59:46.741897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T12:59:46.842272Z","title":"Schulman, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.842272Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:0f28b21af840ac1335a253d7871f09f2796f40a431f868f1ec1413987be8d87a","observation_id":"affcfb43-06b0-4c29-b9f0-a9397c72fec3","resolution":{"observed_at":"2026-08-07T12:59:46.842272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T12:59:46.991866Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:46.991866Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:0b9e6a3bffe4f4e0a36328ef4e49ebd115d0c6a0598c4047d0b84cf62d7bafb2","observation_id":"f4287c15-8172-459b-863a-289302a6ce41","resolution":{"observed_at":"2026-08-07T12:59:46.991866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:59:47.080154Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.080154Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:3366246756b2d12a11768e49dc4397715b590c898e9e097c8f6f4f91d0165552","observation_id":"119a85bf-f936-4372-865c-ad5fec2e324e","resolution":{"observed_at":"2026-08-07T12:59:47.080154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-08-10T02:51:51.955386Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-08-07T12:59:47.229540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.229540Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:5f0c32e22702269feea0ecbcee339a68951a8dfc526ee5f56446f0ebfcc1e4d7","observation_id":"ef203d19-aad7-492f-8405-b79b262047f3","resolution":{"observed_at":"2026-08-07T12:59:47.229540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:59:47.359724Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.359724Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:1c5ada7d7d32764994efadf253e3d70e3158a49af927f32b626480a22019b3f8","observation_id":"e7bb1405-a6c5-4f81-b012-9c8576dee5c9","resolution":{"observed_at":"2026-08-07T12:59:47.359724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:59:47.506865Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.506865Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:d1455c9328c95efa23f101c3ac3254c3fa700c4b7e05879a9b51c83dc251b09e","observation_id":"126dde1d-c5fd-4ec2-810a-70f7a6e82833","resolution":{"observed_at":"2026-08-07T12:59:47.506865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01295","last_updated":"2024-04-01T17:59:06Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:59:06Z","title":"Towards Safety and Helpfulness Balanced Responses via Controllable Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01295","snapshot_observed_at":"2026-08-07T12:59:47.666105Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.666105Z"},"links":{"cited_paper":"/paper/2404.01295","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:6470c2b3250d9ece4e37e24355f7db9df9ccbe4bd6be5bba6c1ff1117e45d058","observation_id":"c098633a-f25b-4ad0-bd18-8f66ba24e76e","resolution":{"observed_at":"2026-08-07T12:59:47.666105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-06T09:12:58.062581Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-07T12:59:47.775977Z","title":"W ang, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.775977Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:594fc2f18de81b231256be9aeba9f2979384559116d5e8620c34d1e860bb9e02","observation_id":"4be40304-6593-490b-9633-e738ab1320a2","resolution":{"observed_at":"2026-08-07T12:59:47.775977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11962","last_updated":"2025-06-25T09:51:33Z","snapshot_observed_at":"2026-08-07T18:11:55.549261Z","submitted_at":"2025-02-17T16:10:30Z","title":"Balancing Truthfulness and Informativeness with Uncertainty-Aware Instruction Fine-Tuning","version":3},"cited_work":{"arxiv_id":"2502.11962","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.11962","snapshot_observed_at":"2026-08-07T12:59:49.479580Z","title":"Balancing Truthfulness and Informativeness with Uncertainty-Aware Instruction Fine-Tuning","venue":"cs.CL","work_id":"4c0de492-48a6-498b-936e-5f724bcdf21d","year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:47.876252Z"},"links":{"cited_paper":"/paper/2502.11962","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:d2435b3bc05ad0503da88db54fc4bf50eb0a85a9d453425e2d989c95eabb5aa2","observation_id":"ffdd6de7-4d7a-4546-80f4-97f8a1324b4b","resolution":{"observed_at":"2026-08-07T12:59:49.583436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:50.524850Z","title":null,"venue":null,"work_id":"d20ae783-6ae5-4120-a724-78265654950d","year":2020},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.013858Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:ef6e1047037e26eaff50ee4d482b2ebdb5ad637d4c8c99e2d715cb0cae2a85ad","observation_id":"e5783d80-1ead-4e57-9135-51ec6639f0f9","resolution":{"observed_at":"2026-08-07T12:59:50.617804Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-07T12:59:48.111769Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.111769Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:22f551dd3952d0fd5a717afd3cd65d1acc404af9bed91f45cfbaf5bdef3a8a4d","observation_id":"5a983e2c-f021-444c-964b-9088cb1550be","resolution":{"observed_at":"2026-08-07T12:59:48.111769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T12:59:48.283646Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.283646Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:7906e98434cab2b71b2b67c4bab6d8cf0ef872751c71474dde09b8280ea6c271","observation_id":"fb94bad4-608f-4d77-a0c3-982c36af98d4","resolution":{"observed_at":"2026-08-07T12:59:48.283646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:50.380596Z","title":null,"venue":null,"work_id":"7fcca086-1f57-4331-8951-1df44d74fc11","year":2024},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.421561Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:9181ebdabe29dbf7dba1eaf36fd95e81e9d82e87bc75952be9ea152591331d71","observation_id":"89d871bd-b7f4-4f56-9a54-030a5549edef","resolution":{"observed_at":"2026-08-07T12:59:50.416612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T12:59:48.554997Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.554997Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:5e58456551607ba506193882cffe730766816710021e6593465b048b5d0364ef","observation_id":"aa45b29e-9039-478e-b74b-7f210b2826c2","resolution":{"observed_at":"2026-08-07T12:59:48.554997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:48.646323Z","title":"Zhang and C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.646323Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:64880666c4a3b0bef9a4deb839181759d3ff5c2ffc6954ac6279c47b8cdb6bfa","observation_id":"4bc96b5a-387e-48fa-9098-d040458b63c4","resolution":{"observed_at":"2026-08-07T12:59:48.646323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T12:59:48.798191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.798191Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:2d5550dcf06930f3c2e6d21acd09dc95e3d006d423ea4eb047561db6624f9bc6","observation_id":"6882edae-8191-403f-89d4-5bfd3b936fea","resolution":{"observed_at":"2026-08-07T12:59:48.798191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-07T12:59:48.911300Z","title":"Zheng, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:48.911300Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:15ec19acc15e7f0615f4a60cbfb7e67d2668716ab8a4fa7152cf7dbbf1313de4","observation_id":"b043d61d-bef4-4eca-8649-e5a056901647","resolution":{"observed_at":"2026-08-07T12:59:48.911300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T12:59:49.025901Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.025901Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:e4f4ab633685b2ecfc5343605e9c292f89e0d68d51b5802d74111ae63efee725","observation_id":"61a6078d-05bc-40bf-9c16-cd974259432c","resolution":{"observed_at":"2026-08-07T12:59:49.025901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:50.236670Z","title":null,"venue":null,"work_id":"88250f8c-caff-4bd6-bd84-8fdea8481a9c","year":1974},"citing_paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:49.168492Z"},"links":{"citing_paper":"/paper/2505.23247"},"observation_digest":"sha256:f0f0c288a4ca20c7e940801e7fdb788df7842e5da550cdbdfa88ad43d655a99e","observation_id":"4d408927-a50c-40c7-8209-de3ac31fc322","resolution":{"observed_at":"2026-08-07T12:59:50.328967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23247","last_updated":"2025-06-17T06:41:40Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T02:52:48.102229Z","submitted_at":"2025-05-29T08:54:06Z","title":"Accelerating RLHF Training with Reward Variance Increase"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2505.23247."}