{"as_of":"2026-08-09T22:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b027d28a419a78ef13163f033f90aa4f7512655756c8acb6b66dab55b368ae58","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:03:53.312441Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:34:25.000468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T01:09:19.294881Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04270","snapshot_observed_at":"2026-08-06T16:34:25.000468Z","title":"Pilaf: Optimal human preference sampling for reward modeling.arXiv preprint arXiv:2502.04270,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.000468Z"},"links":{"cited_paper":"/paper/2502.04270","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:840a12b7849ad332df5bedf2f50a564d030c3562da83f8bc134fbd05ea7abbb3","observation_id":"afdb69b1-e454-4c5a-b4ef-a50ba8294804","resolution":{"observed_at":"2026-08-06T16:34:25.000468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"cited_work":{"arxiv_id":"2502.04270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04270","snapshot_observed_at":"2026-07-04T01:09:19.294881Z","title":"Go, D., Korbak, T., Kruszewski, G., Rozen, J., Ryu, N., and Dymetman, M","venue":null,"work_id":"13a48d65-e3d2-43cc-870b-a5e6447aac9d","year":null},"citing_paper":{"arxiv_id":"2605.06977","last_updated":"2026-05-07T21:48:26Z","snapshot_observed_at":"2026-07-06T23:19:25.538514Z","submitted_at":"2026-05-07T21:48:26Z","title":"$f$-Divergence Regularized RLHF: Two Tales of Sampling and Unified Analyses","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:13:29.292351Z"},"links":{"cited_paper":"/paper/2502.04270","citing_paper":"/paper/2605.06977"},"observation_digest":"sha256:e1a17cb1807ae3f738d2a74c2c3517c412e5fb8fa4c830ddf32344cc778b3646","observation_id":"17a7ff4f-ca29-4304-8976-aa512fab2665","resolution":{"observed_at":"2026-05-11T04:35:58.750065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"cited_work":{"arxiv_id":"2502.04270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04270","snapshot_observed_at":"2026-07-04T01:09:19.294881Z","title":"Go, D., Korbak, T., Kruszewski, G., Rozen, J., Ryu, N., and Dymetman, M","venue":null,"work_id":"13a48d65-e3d2-43cc-870b-a5e6447aac9d","year":null},"citing_paper":{"arxiv_id":"2606.19607","last_updated":"2026-06-17T21:19:01Z","snapshot_observed_at":"2026-08-02T22:14:26.237081Z","submitted_at":"2026-06-17T21:19:01Z","title":"Which Pairs to Compare for LLM Post-Training?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T20:37:19.221848Z"},"links":{"cited_paper":"/paper/2502.04270","citing_paper":"/paper/2606.19607"},"observation_digest":"sha256:a1a3b308c5747085d3037edb34497e55ee74b3942fdc6e9a6163c616dfb8cc86","observation_id":"edfe710a-2dec-40be-a4fb-e9c1886a31d9","resolution":{"observed_at":"2026-07-04T01:09:19.296921Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04270/citation-record","integrity":"/paper/2502.04270/integrity","json":"/paper/2502.04270/citation-record.json","paper":"/paper/2502.04270"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:52.987311Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:52.987311Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:c6bd6acf8748585d73e6166a10f2084ee107191cbdb232907ea03241196462df","observation_id":"cd111811-bc5b-49eb-bf8e-46c0ebfbf20b","resolution":{"observed_at":"2026-08-08T23:03:52.987311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T23:03:52.994878Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:52.994878Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:d2f7d48fd74206791ce1fc06bc623e55902c68ac3dbf7a8a8b75f4a913141ebb","observation_id":"b78b1f42-43ce-4d99-8b4a-a286343de7de","resolution":{"observed_at":"2026-08-08T23:03:52.994878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.002290Z","title":"G., Guo, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.002290Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:0c5d53f77469f5159c2df06198b7997027c920dd51543ee9c1df17e3d26454cf","observation_id":"f6bedace-62c6-40fa-b99b-9e3ddcc879ca","resolution":{"observed_at":"2026-08-08T23:03:53.002290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-08T23:03:53.008646Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.008646Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:4d7a2965017eb54ee77ccbabb681571d83da7c58c5f9fbf6ba2495713a4e7e41","observation_id":"d366c147-6187-445b-a00b-cad225c9df7c","resolution":{"observed_at":"2026-08-08T23:03:53.008646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19320","last_updated":"2025-02-19T00:51:58Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:51:42Z","title":"Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19320","snapshot_observed_at":"2026-08-08T23:03:53.016827Z","title":"Value-incentivized preference optimization: A unified approach to online and offline rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.016827Z"},"links":{"cited_paper":"/paper/2405.19320","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:4170e7798700254265f442f8b89002a8ed1c9f6a439e0753fc22a90a140ef1a4","observation_id":"838970c1-5395-4dac-8aa1-c3ae94305c32","resolution":{"observed_at":"2026-08-08T23:03:53.016827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.022691Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.022691Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:89d11207783d28a0e5e4c70b446833cc46cc8ae262c513a1787d14aa7be524c3","observation_id":"947a26fa-6a17-409c-b893-4e575b955a2a","resolution":{"observed_at":"2026-08-08T23:03:53.022691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.4839","last_updated":"2013-06-20T10:53:42Z","snapshot_observed_at":"2026-08-09T21:46:44.280239Z","submitted_at":"2012-05-22T08:36:41Z","title":"Off-Policy Actor-Critic","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.4839","snapshot_observed_at":"2026-08-08T23:03:53.028525Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.028525Z"},"links":{"cited_paper":"/paper/1205.4839","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:e943ae92a0c2224a091edaf4fec4acf5c9ec4c56a110f994377716e7e24ff417","observation_id":"63871527-a189-4f20-b578-52c2574926f1","resolution":{"observed_at":"2026-08-08T23:03:53.028525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.421653Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":"a8078e50-a3e6-429d-80e0-2163822197c6","year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.034733Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:121c70138841ddd0846a54f8dd8220bf6e8f82c3de14ea4e1d9a866b594acb48","observation_id":"761777f9-ca75-45c0-b01f-9458df276dd2","resolution":{"observed_at":"2026-08-08T23:03:54.430520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.395488Z","title":"Rlhf workflow: From reward modeling to online rlhf, 2024","venue":null,"work_id":"203e5aab-5952-423c-997f-c74bdb4ffedf","year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.040539Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:eaecefd5c54e7d2b45cc8d2432ec1d6cdcdefa686a1e473579b746f109c7ecb5","observation_id":"2c0eab95-ced4-4f35-ac75-f71210376015","resolution":{"observed_at":"2026-08-08T23:03:54.404208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T23:03:53.045855Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.045855Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:83f85ac9b8475808ccc22200aff1ab8ab45898ba2cf5036cc4462fe93c6e5181","observation_id":"8ad2621a-5c92-4661-9397-cf82252950d7","resolution":{"observed_at":"2026-08-08T23:03:53.045855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-08T23:03:53.051581Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.051581Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:30a5d77a824dedb6901eeb09e3b0770e4b0ac698bc6c73e6771c4dd9d8d380f7","observation_id":"1150a4df-239e-4938-916c-1c35dff9eef5","resolution":{"observed_at":"2026-08-08T23:03:53.051581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.370521Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"71c10847-52e1-45c4-ac40-881d98bcb832","year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.059076Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:aa235a3f5469ca5c696b2e86fee2bc72639c4f6fdff875f41cb2405bdaf2fb91","observation_id":"e40fb42b-1869-4cf7-ae12-60c7794bb127","resolution":{"observed_at":"2026-08-08T23:03:54.377898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.346053Z","title":"L., and Baxter, J","venue":null,"work_id":"a3e05771-91c4-45de-b7b9-f2de97c7c0e5","year":2004},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.067691Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:859d13d7cdf1ab05d67dee9dcacdb43f6dfca8d4a772f704ec582849f588cf18","observation_id":"6cc714cd-169f-4aea-b35e-ed6641c58a34","resolution":{"observed_at":"2026-08-08T23:03:54.352936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.328645Z","title":"S., Lillicrap, T., Turner, R","venue":null,"work_id":"d9afc9ae-8648-485d-805d-f7f71bdc06ba","year":2017},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.073245Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:a9c1448e16628c2378dc3ca1eff67e86953adbec04850fc5fca38efcf41ffb10","observation_id":"91269a7e-356b-475a-a7ee-5548ece0c4cd","resolution":{"observed_at":"2026-08-08T23:03:54.334407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-09T00:20:15.609286Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-08T23:03:53.079636Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.079636Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:842dc6e2b989a6c287577a20eea1498b8e40e4dad4ddc4d26e8568fe3b31d4f2","observation_id":"45ccfa6a-012b-4955-a9d8-ff9a8851a250","resolution":{"observed_at":"2026-08-08T23:03:53.079636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-08T23:03:53.088095Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.088095Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:5de3effa61673a112a41055c0f862668f957190cb2eb31a6db7fd6ac276ae5bf","observation_id":"9915083f-08c0-4946-94d3-e01d97f12f3e","resolution":{"observed_at":"2026-08-08T23:03:53.088095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09401","last_updated":"2025-02-11T18:18:59Z","snapshot_observed_at":"2026-08-09T10:20:56.103315Z","submitted_at":"2024-02-14T18:58:40Z","title":"Reinforcement Learning from Human Feedback with Active Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09401","snapshot_observed_at":"2026-08-08T23:03:53.095156Z","title":"Reinforcement learning from human feedback with active queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.095156Z"},"links":{"cited_paper":"/paper/2402.09401","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:0d9f78bf84623b370afa37bd6984e0ade144dc0974cda61475edb9a26362ce58","observation_id":"b963b863-fbed-47c6-a40a-e41b21635caf","resolution":{"observed_at":"2026-08-08T23:03:53.095156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.302328Z","title":"and Uehara, M","venue":null,"work_id":"dccc7e5d-7e89-46d3-b318-2ea508535e56","year":2020},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.101188Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:781278c8ae5d653fed54025868066c2a38545630596136c6023c74e43edd1c21","observation_id":"9bdf1632-d609-4672-8d08-64d1603b2c39","resolution":{"observed_at":"2026-08-08T23:03:54.310951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.276596Z","title":null,"venue":null,"work_id":"26a1b7fe-62b0-4f46-8168-0044e3435c5e","year":2008},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.117344Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:71578f4aed2753cfc0bb60374e37d6288132a2aa16f8190af048b483b842b044","observation_id":"fd3d0c60-2e79-4346-8888-ecfcda468890","resolution":{"observed_at":"2026-08-08T23:03:54.282274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.255917Z","title":"Y., Chandu, K., Dziri, N., Kumar, S., Zick, T., Choi, Y., Smith, N","venue":null,"work_id":"c0ca4ea0-c65e-41e6-babb-176557bc7d4d","year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.123719Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:407713ae44619a61fb4842ba97d156a57ec950827a2070bbb18ce27a390b73e3","observation_id":"84c754f6-4510-434f-9f67-a9ebe0961861","resolution":{"observed_at":"2026-08-08T23:03:54.263739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-08T23:03:53.130190Z","title":"Let's verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.130190Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:a344ec8f2ef4cd53ddf1a911457b5ae37814cba4b6cd424aaf2442506d38a3ca","observation_id":"f6dfccbc-8622-4394-a503-5663da3b61b8","resolution":{"observed_at":"2026-08-08T23:03:53.130190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.225688Z","title":null,"venue":null,"work_id":"f079db3e-0cb8-4cb3-9b38-d277ad428c15","year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.136921Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:1c54537fc529af1c9a357ffb9b33242075025503610b720a83c7d1ce89bf6801","observation_id":"0405fa58-2304-4dc4-b7ec-12ea28d1299a","resolution":{"observed_at":"2026-08-08T23:03:54.234159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-07T05:53:12.643515Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-08T23:03:53.142987Z","title":"Y., Zeng, L., Liu, J., Yan, R., He, J., Wang, C., Yan, S., Liu, Y., and Zhou, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.142987Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:b5ab96f16271b68765b616aeb0fafb8750d80aa16f0da14ecb5c31ab7869ec97","observation_id":"ed352f6a-cebd-4543-a119-bf15d9a7874b","resolution":{"observed_at":"2026-08-08T23:03:53.142987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02992","last_updated":"2024-05-24T08:39:07Z","snapshot_observed_at":"2026-07-06T17:25:26.813696Z","submitted_at":"2024-02-05T13:31:28Z","title":"Decoding-time Realignment of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02992","snapshot_observed_at":"2026-08-08T23:03:53.148096Z","title":"Decoding-time realignment of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.148096Z"},"links":{"cited_paper":"/paper/2402.02992","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:710a48dbb132ed99d8ad0b28c65fe915ad7c1895b4dd099ec44b97cfbd7c7ff0","observation_id":"0ae139a1-50fd-426e-833d-3e0c37fbb40f","resolution":{"observed_at":"2026-08-08T23:03:53.148096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.187359Z","title":"J., and Liu, J","venue":null,"work_id":"89228057-426e-4392-a6be-c2a251e7ab90","year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.153316Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:5e56f1f1eb7a46b44ffa7130c113fd2a9a3de93d404cfc53c879054fbf3cff29","observation_id":"43773dbb-d1c3-4087-a2c6-1ad8d87638cc","resolution":{"observed_at":"2026-08-08T23:03:54.194534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01493","last_updated":"2024-11-09T12:22:19Z","snapshot_observed_at":"2026-07-06T19:44:12.347359Z","submitted_at":"2024-11-03T09:18:28Z","title":"Sample-Efficient Alignment for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01493","snapshot_observed_at":"2026-08-08T23:03:53.158373Z","title":"S., and Lin, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.158373Z"},"links":{"cited_paper":"/paper/2411.01493","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:8478804e3d62201eecb0f5172a57da7e5b75edd7c3a45f1f3e2521e0c7fcfb42","observation_id":"d5bd172c-6ebc-44d1-a806-25d0f200b1b2","resolution":{"observed_at":"2026-08-08T23:03:53.158373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00267","last_updated":"2025-03-20T14:23:17Z","snapshot_observed_at":"2026-07-06T16:55:25.413169Z","submitted_at":"2023-12-01T00:54:02Z","title":"Sample Efficient Preference Alignment in LLMs via Active Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00267","snapshot_observed_at":"2026-08-08T23:03:53.163898Z","title":"Sample efficient reinforcement learning from human feedback via active exploration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.163898Z"},"links":{"cited_paper":"/paper/2312.00267","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:d0826fb3bb919a992d25fdb0d009f3ddd6a5d68576d9e2f30233fdcb7ae7488a","observation_id":"21a221cf-c917-4b45-a6cd-1a665e0ac4c6","resolution":{"observed_at":"2026-08-08T23:03:53.163898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.151080Z","title":"Active preference learning for large language models","venue":null,"work_id":"7db817fb-eac4-483c-a30f-bf3513e3004c","year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.172195Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:5f31bcf451be98a8357f9c14d7231ccf329ffdcbd43e9f43524fe5ebe38512db","observation_id":"391fe1c4-7614-4114-af2f-2c2254b3ff68","resolution":{"observed_at":"2026-08-08T23:03:54.160584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.179236Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.179236Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:d81cc9da9474851b7691f20a87f58708cc22f9caad506fac7637e8ecb987cba7","observation_id":"4c2ea069-f21c-4644-a552-e539434b2813","resolution":{"observed_at":"2026-08-08T23:03:53.179236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.188424Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.188424Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:60af65acf7f57eb68deede7e9894d2edfe7e621b063231e4ade4db4c942f48a1","observation_id":"9a4e0b24-88bd-4097-b46c-05ca1cf15a58","resolution":{"observed_at":"2026-08-08T23:03:53.188424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17055","last_updated":"2024-10-23T12:55:39Z","snapshot_observed_at":"2026-08-03T19:40:12.558709Z","submitted_at":"2024-10-22T14:36:44Z","title":"Optimal Design for Reward Modeling in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17055","snapshot_observed_at":"2026-08-08T23:03:53.198647Z","title":"I., M \\'e nard, P., Moulines, E., and Valko, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.198647Z"},"links":{"cited_paper":"/paper/2410.17055","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:fcd59acd7d02dcf7172006ec830840e58d669f6fdfb90817b6b125d358f6e18a","observation_id":"31a84014-6480-4388-aaaa-8d299a07ea28","resolution":{"observed_at":"2026-08-08T23:03:53.198647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T23:03:53.204982Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.204982Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:02535f64296a6e73c5e0cc92c744334ea8527d901c4dec98511acc2ff01319c3","observation_id":"addf575c-03f8-4356-b91d-4568330cad1a","resolution":{"observed_at":"2026-08-08T23:03:53.204982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19605","last_updated":"2025-02-02T09:18:06Z","snapshot_observed_at":"2026-08-03T19:12:31.794958Z","submitted_at":"2024-09-29T07:53:50Z","title":"The Crucial Role of Samplers in Online Direct Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19605","snapshot_observed_at":"2026-08-08T23:03:53.212190Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.212190Z"},"links":{"cited_paper":"/paper/2409.19605","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:5bad07c583b7d23af281b27075f22ff6fdac843edbd269b06564a05b9a41293b","observation_id":"00c51ad8-6c46-4b97-819d-695d06df7778","resolution":{"observed_at":"2026-08-08T23:03:53.212190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.219913Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.219913Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:842d08d3596d35fb5a00b3ec9e9ccb6fc5cfa7c00e8d4f7693ac13ba662e1245","observation_id":"94df5939-c90a-40eb-8662-ed50ecc27064","resolution":{"observed_at":"2026-08-08T23:03:53.219913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.231744Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.231744Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:db91d124f1bf0c9812484011ff0ac86f28a4e21e428653f9d639dc94a460d96f","observation_id":"0c0876af-7dad-40b8-a74d-14472e586c96","resolution":{"observed_at":"2026-08-08T23:03:53.231744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-08T23:03:53.249843Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.249843Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:ad05335b7f27f643141c9d9d29e62ceb11d97bd7764f901b2977a660a28ad614","observation_id":"f14a3650-1869-402e-8243-0d3f6210273e","resolution":{"observed_at":"2026-08-08T23:03:53.249843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.257479Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.257479Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:a69d756273ab24e5942b7389ce02a18fb3430ebbec98d99dc063eb268fdc2243","observation_id":"271913c1-26bf-46d4-b332-b737d0649152","resolution":{"observed_at":"2026-08-08T23:03:53.257479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-07-31T03:29:04.443362Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-08T23:03:53.263456Z","title":"J., Krishnamurthy, A., Rosset, C., Awadallah, A., and Rakhlin, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.263456Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:87771a4fa4e2cdc0a26c6df192d5e8c7a378dad33d393845940dd21c2aedd463","observation_id":"2c180d6a-0f93-4327-9a29-0f37aeb3f691","resolution":{"observed_at":"2026-08-08T23:03:53.263456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:54.005108Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":"fc72b0ee-bfce-4d21-a0bb-d11b9e571c88","year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.269428Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:c0426c7991f4acbd3d1727c64d93c7ec8e21167bcab903d0eb700a9e12c5a24c","observation_id":"50d3db4a-b21c-490e-9b23-72a1243ea515","resolution":{"observed_at":"2026-08-08T23:03:54.013289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.979214Z","title":null,"venue":null,"work_id":"ebd8e195-f9f4-4fef-88e6-b23de47cae2e","year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.275113Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:077d9d55b8912e67e52f314595b8ed98051201d86314129eebb9897534f37b7d","observation_id":"2179c1ad-d998-4e90-9b57-cec8f33112ff","resolution":{"observed_at":"2026-08-08T23:03:53.986431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-06T05:33:43.589358Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-08T23:03:53.280173Z","title":"Some things are more cringe than others: Preference optimization with the pairwise cringe loss","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.280173Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:b77cd29a19db8bd4422b641d667842ce8aa0c64290289c82190abef6fd27533b","observation_id":"64b1dcd3-0cac-4cc7-a338-22b0006d5f07","resolution":{"observed_at":"2026-08-08T23:03:53.280173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04343","last_updated":"2025-03-02T19:44:37Z","snapshot_observed_at":"2026-08-08T03:13:21.759513Z","submitted_at":"2024-10-06T03:42:15Z","title":"Inference Scaling for Long-Context Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04343","snapshot_observed_at":"2026-08-08T23:03:53.286885Z","title":"Inference scaling for long-context retrieval augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.286885Z"},"links":{"cited_paper":"/paper/2410.04343","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:e8ee8a5bc165d7c6031e23d81ec19045e306860512772895d91d3e420ceb53f6","observation_id":"564d187d-2518-475f-9d04-2b782da60d06","resolution":{"observed_at":"2026-08-08T23:03:53.286885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19332","last_updated":"2024-11-05T07:21:18Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:59:07Z","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19332","snapshot_observed_at":"2026-08-08T23:03:53.293003Z","title":"Self-exploring language models: Active preference elicitation for online alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.293003Z"},"links":{"cited_paper":"/paper/2405.19332","citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:4ded47c3d990f87a35f7ae0722ca1e6ceaf6dad39d9729448997951666434391","observation_id":"c09f1447-2d90-4e96-bf86-e8d9d5c36f80","resolution":{"observed_at":"2026-08-08T23:03:53.293003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.299180Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.299180Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:e1e063e81665bd51ec10c561097cae947fd57b8d7a24a446757bbb23b0f16d64","observation_id":"a929772c-ed3a-491f-bbb6-b01a47469ff6","resolution":{"observed_at":"2026-08-08T23:03:53.299180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.307149Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.307149Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:950a1df4fa0cf26c977035e2eec9fd179a468f543259db363e6ff9425b75fea8","observation_id":"6c99ebb6-acea-4927-83e3-1c108421f5c1","resolution":{"observed_at":"2026-08-08T23:03:53.307149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T23:03:53.312441Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T23:03:53.312441Z"},"links":{"citing_paper":"/paper/2502.04270"},"observation_digest":"sha256:6d5e24577f83f8e294dc441e461ab22285250b1041bec832d146f396dc162700","observation_id":"d9d65432-a03b-4fc4-937b-532a80d351f6","resolution":{"observed_at":"2026-08-08T23:03:53.312441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04270","last_updated":"2025-02-06T18:09:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T23:24:40.596102Z","submitted_at":"2025-02-06T18:09:00Z","title":"PILAF: Optimal Human Preference Sampling for Reward Modeling"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 3 inbound Pith citation observations for arXiv:2502.04270."}