{"as_of":"2026-08-10T11:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3bcbf01c6ceb9de56286fc94e95934b1d37d05e7e98e3234d437b00b2b6233d9","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:32:21.331060Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.10505/citation-record","integrity":"/paper/2502.10505/integrity","json":"/paper/2502.10505/citation-record.json","paper":"/paper/2502.10505"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:23.022939Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":"9734ad25-bcde-4936-b522-d33c183827b4","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.903864Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:72c5fbabd7777dd543136fd2b943bacac440fed227b4fa9e62f614688f55f98d","observation_id":"d6180138-a454-4301-9e33-643e150b0bb8","resolution":{"observed_at":"2026-08-07T18:32:23.028818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.999345Z","title":"Calibration and consistency of adversarial surrogate losses","venue":null,"work_id":"4eec21be-b4eb-4ab2-a74a-a8f5d8355777","year":2021},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.910320Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:f253d8f1d3a570480991eda0e3cdb07d3446a67a36739b94ddfb0bcce97050aa","observation_id":"1b074722-1adc-408b-b4cb-9b3f3040dc52","resolution":{"observed_at":"2026-08-07T18:32:23.007001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.977502Z","title":"Multi-class h -consistency bounds","venue":null,"work_id":"029f3f57-af18-45f0-b1b6-e5b16ef1acfc","year":2022},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.916903Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:ba4c62a99637ca8bc7cadb264531bee77906cfb8f8f20861ce87c3a8e3be6999","observation_id":"4c251466-16c3-4b63-b3ac-5d2ad985737c","resolution":{"observed_at":"2026-08-07T18:32:22.983272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.959995Z","title":"G., Rowland, M., Piot, B., Guo, D., Calandriello, D., Valko, M., and Munos, R","venue":null,"work_id":"231f9361-7900-4e59-891f-7f65abb4e900","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.924819Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:70597a56a3637e5c709e027acbb99e26fa0eaf2feb9568a81083803501909445","observation_id":"4c2cc416-e36f-4b17-94ca-93af7a38517c","resolution":{"observed_at":"2026-08-07T18:32:22.965345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.932090Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":"f9ad7eb6-2cf5-4e96-928f-f746dfb4433c","year":2022},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.932361Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:107c6057f27316cfc2c555c3afbcbe640080289ea38b24abc544bba9f849ebfc","observation_id":"d8ab9d49-91d5-49cd-a64c-2dc628851e04","resolution":{"observed_at":"2026-08-07T18:32:22.938806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-08-07T23:49:29.478548Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01373","snapshot_observed_at":"2026-08-07T18:32:20.938380Z","title":"G., Bradley, H., O'Brien, K., Hallahan, E., Khan, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.938380Z"},"links":{"cited_paper":"/paper/2304.01373","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:2e372ab18265bcab12a834cfb77bf25ccb21fc6719c3d39bf4795bcf503ca3f7","observation_id":"bad98efd-8a4b-48f9-9230-63a8f1eee886","resolution":{"observed_at":"2026-08-07T18:32:20.938380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00950","last_updated":"2021-12-02T03:08:23Z","snapshot_observed_at":"2026-08-10T08:55:52.462199Z","submitted_at":"2021-12-02T03:08:23Z","title":"Quantile Filtered Imitation Learning","version":1},"cited_work":{"arxiv_id":"2112.00950","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00950","snapshot_observed_at":"2026-08-07T18:32:22.002044Z","title":"Quantile Filtered Imitation Learning","venue":"cs.LG","work_id":"da01327a-a083-4d3e-9825-f9adbe895090","year":2021},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.946064Z"},"links":{"cited_paper":"/paper/2112.00950","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:41ae1be6f30cf17ae2e7912be4e49bc5f37f14b49f10b503feaf40f5410d113a","observation_id":"5e77688e-f12f-4247-b719-10fae9e6a0b8","resolution":{"observed_at":"2026-08-07T18:32:22.012736Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.913497Z","title":"Probabilistic interpretation of feedforward classification network outputs, with relationships to statistical pattern recognition","venue":null,"work_id":"7619e609-c95c-4ca2-9e69-8c109332061b","year":1990},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.952817Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:15f02d440bf71281e92100d9ca1041f08f662db7a41bf2c58c65884371cf43e1","observation_id":"43afe68a-4ec2-412e-85dc-3230471c94a9","resolution":{"observed_at":"2026-08-07T18:32:22.919649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08635","last_updated":"2024-03-13T15:47:26Z","snapshot_observed_at":"2026-08-10T07:02:54.243492Z","submitted_at":"2024-03-13T15:47:26Z","title":"Human Alignment of Large Language Models through Online Preference Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08635","snapshot_observed_at":"2026-08-07T18:32:20.963680Z","title":"A., Richemond, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.963680Z"},"links":{"cited_paper":"/paper/2403.08635","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:d0f3ab3900800d1565de746fc8329b12bbfb0461925de989b5e23ce930033578","observation_id":"9f07e96b-2159-4740-a1d1-875239dda663","resolution":{"observed_at":"2026-08-07T18:32:20.963680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.892593Z","title":"H., Chen, X., Zhang, Q., Ranganath, R., and Cho, K","venue":null,"work_id":"df87769b-baec-41b7-a6f1-297ea61d8e6c","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.971802Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:29c24089e43d0b97e45571828667184996f20da7cfac6dd9799701843d21f719","observation_id":"8107c9da-f2c5-40f5-8b2f-330139a41e75","resolution":{"observed_at":"2026-08-07T18:32:22.898525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-03T14:31:51.401500Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-07T18:32:20.983164Z","title":"F., Leike, J., Brown, T","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.983164Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:0df4287f9bf8192f7ac36ba2af27c27f214bfb1c38929bd885fa73accd2fd317","observation_id":"2902befc-3e72-43b6-acfe-88eb4cef412d","resolution":{"observed_at":"2026-08-07T18:32:20.983164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.858526Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":"19068236-5210-42a8-bbaf-4f2cba981d1e","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:20.989748Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:8ea3ef2bd6bb99737f4d995750edab53534712282ffe3a0f0b286aa48a267fec","observation_id":"b619d067-3659-4495-ad93-2921e730fb13","resolution":{"observed_at":"2026-08-07T18:32:22.864549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.832857Z","title":"Understanding dataset difficulty with v-usable information","venue":null,"work_id":"1e04853e-f13e-4440-a557-479603186019","year":2022},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.001625Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:1742b55e81f04965073c11d6a72089b115806072842f5c4125015df688294e32","observation_id":"51dd05ae-79b1-41fc-ba02-c0308782ba0f","resolution":{"observed_at":"2026-08-07T18:32:22.839675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.807683Z","title":"Bonbon alignment for large language models and the sweetness of best-of-n sampling","venue":null,"work_id":"b5d8edbe-17df-4fac-a821-8d79b38f33e4","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.008913Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:579255bcb2fb1b61a56827d44477bb4133e48280d2e232d04cbbbbe34117ec44","observation_id":"c5d841ae-b317-4623-9930-c2b9d97c89b4","resolution":{"observed_at":"2026-08-07T18:32:22.814056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.782877Z","title":"L., Srinivasan, S., Konyushkova, K., Weerts, L., Sharma, A., Siddhant, A., Ahern, A., Wang, M., Gu, C., Macherey, W., Doucet, A., Firat, O., and de Freitas, N","venue":null,"work_id":"5f72c4e1-f0b7-43c3-a9dd-854ce1a7d332","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.015499Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:76ab08a6fdbc03a704d0d316fb05b61dc3a210c322489eee10b04c04a50876ac","observation_id":"b64d9244-8006-498c-96d9-4831e68de4b7","resolution":{"observed_at":"2026-08-07T18:32:22.788839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-07T18:32:21.022389Z","title":"Direct language model alignment from online ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.022389Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:c368d26aacbecf02aba0325937c70e28f6a354464b6048c9949be8bb6d7eb34f","observation_id":"5724ed26-706e-4021-a240-b524f4676b17","resolution":{"observed_at":"2026-08-07T18:32:21.022389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21662","last_updated":"2025-02-16T20:19:36Z","snapshot_observed_at":"2026-07-06T19:41:15.267950Z","submitted_at":"2024-10-29T02:11:45Z","title":"$f$-PO: Generalizing Preference Optimization with $f$-divergence Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21662","snapshot_observed_at":"2026-08-07T18:32:21.028109Z","title":"f -po: Generalizing preference optimization with f -divergence minimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.028109Z"},"links":{"cited_paper":"/paper/2410.21662","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:ea2e4832b456de03e632b16a1e521f471eac8a24780b57848c48875be572d3b3","observation_id":"40ae999b-8da0-42a5-b001-6d340fead544","resolution":{"observed_at":"2026-08-07T18:32:21.028109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13399","last_updated":"2025-02-18T17:16:55Z","snapshot_observed_at":"2026-08-07T03:47:17.449911Z","submitted_at":"2024-07-18T11:08:40Z","title":"Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13399","snapshot_observed_at":"2026-08-07T18:32:21.033460Z","title":"D., Sun, W., Krishnamurthy, A., and Foster, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.033460Z"},"links":{"cited_paper":"/paper/2407.13399","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:d3ebc5c0e61c3060c2a26080180c319b07e8da475ab64f88b6806cd74188f27a","observation_id":"e3f076e6-6916-4baf-95d1-94ee9fcb0d54","resolution":{"observed_at":"2026-08-07T18:32:21.033460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.755403Z","title":"A., Choi, Y., and Hajishirzi, H","venue":null,"work_id":"cb25b2a0-69a3-4ac2-a235-c583ab3420ef","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.038358Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:4460f85035486a7962e9793ae953a3b6ffef9102d29e50159413f91d8e2c8886","observation_id":"52740ac5-432c-4efb-870d-81ff9b8c7ff2","resolution":{"observed_at":"2026-08-07T18:32:22.766300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00856","last_updated":"2024-06-05T08:15:12Z","snapshot_observed_at":"2026-08-09T21:25:39.237839Z","submitted_at":"2024-02-01T18:51:54Z","title":"Towards Efficient Exact Optimization of Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00856","snapshot_observed_at":"2026-08-07T18:32:21.045898Z","title":"Towards efficient and exact optimization of language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.045898Z"},"links":{"cited_paper":"/paper/2402.00856","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:1f7f9325bd6840bc35321a329e4660c744272af9821f0b634da20aa8cc91dcff","observation_id":"42270018-9ef5-4abf-b241-7186c0528296","resolution":{"observed_at":"2026-08-07T18:32:21.045898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11191","last_updated":"2024-06-18T08:18:33Z","snapshot_observed_at":"2026-08-03T11:31:07.805515Z","submitted_at":"2024-06-17T03:52:51Z","title":"A Survey on Human Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11191","snapshot_observed_at":"2026-08-07T18:32:21.053077Z","title":"A survey on human preference learning for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.053077Z"},"links":{"cited_paper":"/paper/2406.11191","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:cf9a0d2d5bcc2d8e9837ac0749bda6f62098371ffb2ce78feb3b717c268c4234","observation_id":"eb3b3895-c27c-4a72-9c09-74f8b2d8a384","resolution":{"observed_at":"2026-08-07T18:32:21.053077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:21.059995Z","title":"A survey of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.059995Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:6dd6f9b8dd53e61544ba57f9e1caddf0922da353669477a87488e7ed04b37120","observation_id":"f6ba482e-7eed-4cf0-ba69-08f0200da95b","resolution":{"observed_at":"2026-08-07T18:32:21.059995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.724224Z","title":"Understanding the effects of rlhf on llm generalisation and diversity","venue":null,"work_id":"7ad0b7ea-51a8-4c0e-aa03-b747ed105473","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.066417Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:741db65d0837d2d84ed58e9c2a2d109807623fa49b617fd10c03bada5797b76b","observation_id":"15754356-b360-4f9e-948e-14bdfb38a397","resolution":{"observed_at":"2026-08-07T18:32:22.729922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-08-06T15:18:02.072435Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-07T18:32:21.072721Z","title":"R., Stevens, K., Barhoum, A., Duc, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.072721Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:623f9944e38a5b3ee94a5bcc248acf45cd731ca9ece762497a149b2cc51242bf","observation_id":"d73ad913-60ec-4daa-947a-c504d2031a5d","resolution":{"observed_at":"2026-08-07T18:32:21.072721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.701483Z","title":"Huggingface h4 stack exchange preference dataset","venue":null,"work_id":"5f420265-9b01-4393-9a44-647ba44c5132","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.080097Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:d31ff8ae3192dcf6ce6cef5a9ba1c02536a0387cc07868b38e098679b9c9538f","observation_id":"103738c8-633e-451f-be24-7474252aa77b","resolution":{"observed_at":"2026-08-07T18:32:22.710240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06259","last_updated":"2024-03-12T05:22:46Z","snapshot_observed_at":"2026-07-06T16:05:23.421896Z","submitted_at":"2023-08-11T17:47:54Z","title":"Self-Alignment with Instruction Backtranslation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06259","snapshot_observed_at":"2026-08-07T18:32:21.086641Z","title":"Self-alignment with instruction backtranslation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.086641Z"},"links":{"cited_paper":"/paper/2308.06259","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:98daaa84cdb8cb61f206258ec48258a1a40abbbf62ef5402f2863acbce6e375a","observation_id":"367c276c-8757-48fc-ba82-3f127d3ae281","resolution":{"observed_at":"2026-08-07T18:32:21.086641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.679976Z","title":null,"venue":null,"work_id":"94a17ed1-0f62-4e02-b8aa-d8e537a0c4a1","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.093625Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:79d5f0bde607f7390a50725c56cf03679f08eaeb95c8883b394167277f21dd6b","observation_id":"959bff62-81b5-428d-a8df-db9dabe0082d","resolution":{"observed_at":"2026-08-07T18:32:22.686595Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-07T18:32:21.100629Z","title":"A., Socher, R., Amatriain, X., and Gao, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.100629Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:2dddbd63f8c2f5852efbbb5fde16109f8c92a53bd3402040cbc24eb00f03ee31","observation_id":"14b5bd41-343a-4f2a-b5ca-7ae15d2060c1","resolution":{"observed_at":"2026-08-07T18:32:21.100629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.657793Z","title":"Monte carlo gradient estimation in machine learning","venue":null,"work_id":"d64172c8-c093-418e-af6b-efb00d47524e","year":2020},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.113252Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:5b7cb7625811ac6a854d42870222e52511c08d9298f7feb43a3ce56d37b109df","observation_id":"74293d31-b9a8-4b0c-98c0-135fa23159a2","resolution":{"observed_at":"2026-08-07T18:32:22.663308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.636151Z","title":"Monte carlo gradient estimation in machine learning","venue":null,"work_id":"598fc43c-5129-4612-b006-7e52b9924990","year":2020},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.119438Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:a8c444fa1cb043aafc47982384760ee0e0caf2a6db3ce1d6890159a9908203c6","observation_id":"39550b1e-bb78-4ec1-85ed-2813f2bada54","resolution":{"observed_at":"2026-08-07T18:32:22.641721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.613381Z","title":"G., Rowland, M., Guo, Z","venue":null,"work_id":"14d7c271-4de4-4a36-9009-eac15ee80087","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.125490Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:fcce27e8e8af627dc0dfb906ec3550fdfaefac4d32bc8dd741f60928dd46f53b","observation_id":"465c40fd-57e9-44af-9f9e-309cf5c2cfec","resolution":{"observed_at":"2026-08-07T18:32:22.621373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.595612Z","title":"A., Lindsten, F., and Blei, D","venue":null,"work_id":"3870879c-99f7-4c7f-9383-c60edc380f05","year":2020},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.131839Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:7e9e82e5f402497cecf8492417db93d87dee165fcceac592d0c7c930bf75ad04","observation_id":"20c613a0-c772-4fd1-86f1-899de5cc54a6","resolution":{"observed_at":"2026-08-07T18:32:22.601091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.569766Z","title":"Gpt-4 technical report","venue":null,"work_id":"512d1a26-c32e-4880-bdc0-be3ee3c67ef4","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.139010Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:714081f70529e0eb0a66142e3a7b8a6324e23a8abb3f7665a5f2e1aabb302475","observation_id":"5336bf60-2085-4690-9267-135c1e51011f","resolution":{"observed_at":"2026-08-07T18:32:22.582335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T18:32:21.145340Z","title":"L., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., Schulman, J., Hilton, J., Kelton, F., Miller, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.145340Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:dcbc5d7a5336a24d4eb057f32524924e9fdec17352bc20bc7434508f8217d952","observation_id":"816e2397-35a3-4c92-9c0f-9672f797b1e2","resolution":{"observed_at":"2026-08-07T18:32:21.145340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-07T18:32:21.154929Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.154929Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:c581f3bde52969a8f5d91e1a684ff1a12e41795d87735789e08dd61c93bbb75d","observation_id":"fd5fa80e-fc39-44b0-87a1-6a881f593f98","resolution":{"observed_at":"2026-08-07T18:32:21.154929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-07-06T18:25:35.827334Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-07T18:32:21.165463Z","title":"Scaling laws for reward model overoptimization in direct alignment algorithms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.165463Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:61f1e9f2b1c0fc9ff8699f767068ac1ceee63e0e2ad7239eb2c5158f8d84e257","observation_id":"85b9a4a5-97aa-499d-8585-18d3b2556cd4","resolution":{"observed_at":"2026-08-07T18:32:21.165463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.543628Z","title":"From r to q^* : Your language model is secretly a q-function","venue":null,"work_id":"d3275bc6-4198-4355-b902-25c24eef4b4c","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.171588Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:25e709628bd9b21c271dcaa5520e3bf3120e6caf28969ad302a564a128a0e563","observation_id":"f5b4a645-6411-48d5-a1b2-a2dc0a364c3c","resolution":{"observed_at":"2026-08-07T18:32:22.549800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.522323Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"2e6d7885-4aa5-4e2c-b003-f9d2ecca78ac","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.177265Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:179b71e4c13bff64038b8c259ddd94ec28e0a4e6edcc2f98d84efa3a8546bda0","observation_id":"1b439a24-3a82-4014-9314-a15db84d1e18","resolution":{"observed_at":"2026-08-07T18:32:22.528340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.497435Z","title":"Black box variational inference","venue":null,"work_id":"446dddbe-7663-46cc-8b52-000975d0e3d5","year":2014},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.183300Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:9da380263360f97ad9d3e536bd3edef34745b24bf06235dc54f7bbadfae99cd6","observation_id":"05e21823-4197-4c1b-8316-77d5cd106f45","resolution":{"observed_at":"2026-08-07T18:32:22.507183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-07-06T19:31:49.052556Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-07T18:32:21.189249Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.189249Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:fabdf9fae095a35c61692f68f99669d519ac82e02adcdd84b48f01aa2b879644","observation_id":"2b6830b4-152f-418b-afd5-34dffd1e055f","resolution":{"observed_at":"2026-08-07T18:32:21.189249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.470106Z","title":"Vanishing gradients in reinforcement finetuning of language models","venue":null,"work_id":"5f9f9826-f933-4764-85f4-889f0b41cbfc","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.195177Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:8b40be526587d42b9408366cda28cf5d709e8d36a7a5efc954f5585f07b390d5","observation_id":"a389f205-5390-4018-9842-8d8291d01b0c","resolution":{"observed_at":"2026-08-07T18:32:22.481360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.443462Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences, 2024","venue":null,"work_id":"89c8b4b3-6e75-4b06-8a13-546d1a41eeb6","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.200061Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:c5083f832c12e06700cd2e938293f6394ac34c34a5faefd7e69f086b5567f392","observation_id":"cacef77f-dca8-49dd-a1ec-72cd0c5e9daf","resolution":{"observed_at":"2026-08-07T18:32:22.452006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16320","last_updated":"2025-02-22T18:46:33Z","snapshot_observed_at":"2026-08-07T17:56:07.086206Z","submitted_at":"2025-02-22T18:46:33Z","title":"Direct Alignment with Heterogeneous Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16320","snapshot_observed_at":"2026-08-07T18:32:21.206355Z","title":"Direct alignment with heterogeneous preferences","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.206355Z"},"links":{"cited_paper":"/paper/2502.16320","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:bbdad372efa67766793c43167cf124bb0755c1a089ad6d027615642e355ce099","observation_id":"64519d34-4c42-4d2f-a260-b89f02cfed61","resolution":{"observed_at":"2026-08-07T18:32:21.206355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-07T18:32:21.215175Z","title":"A long way to go: Investigating length correlations in rlhf, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.215175Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:166b11dadb9bb89e83472eb35ca6d1611a5a9fd1cd8be04dbd8330ecf40083c5","observation_id":"823f03aa-ab4a-4e29-9d59-69a72139f1aa","resolution":{"observed_at":"2026-08-07T18:32:21.215175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.414753Z","title":"Distributional preference learning: Understanding and accounting for hidden context in rlhf","venue":null,"work_id":"9f32a312-26ba-48a4-9875-c99b00ba34ce","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.221926Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:67f852c67690e7fe7b0b5d8f3d34088bde56b2a6ed1a94518e8cf4cd2d0a0e68","observation_id":"fea3bb9f-372c-4b55-89ef-4ac8e716d64b","resolution":{"observed_at":"2026-08-07T18:32:22.424473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00365-006-0668-8","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:21.387398Z","title":"How to compare different loss functions and their risks","venue":null,"work_id":"dfc42435-0812-447d-ac9e-8935c6382521","year":2007},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.227381Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:736696c5c140243dccaebb0c69b9a593af31a4d7689d4dfb36f1f269639d24f1","observation_id":"d577a9f7-535e-42c8-8c1a-7fde56c8e413","resolution":{"observed_at":"2026-08-07T18:32:21.406280Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-07T18:32:21.232480Z","title":"M., Lowe, R","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.232480Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:802f658495000d14b7b951b89e556441a9e4a8a59d8704a8b464a19a1fd39464","observation_id":"3b65fc6e-bc9e-44f5-a051-1c4c21f62af3","resolution":{"observed_at":"2026-08-07T18:32:21.232480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.389140Z","title":"S., and Agarwal, A","venue":null,"work_id":"15f08a3f-7841-4cb9-9ba2-857bdc9ed3cf","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.237661Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:cc85f7a6bc70dc248557a99de244d6652d9d5c71e48ec881ab2bcdfa5447243b","observation_id":"a9667a6d-961a-4104-b483-ad8b2d1fbb5f","resolution":{"observed_at":"2026-08-07T18:32:22.394366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.369145Z","title":"Preference fine-tuning of llms should leverage suboptimal, on-policy data","venue":null,"work_id":"dd734c3d-9b37-43bb-9f57-d4d43f5494c8","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.243309Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:2e4f140f1397da15336fd9364c7786936e82d1a6b79690c251b75e23fb7749b9","observation_id":"59644008-f9e1-4566-9f7d-bb638ceb40cd","resolution":{"observed_at":"2026-08-07T18:32:22.375130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.341546Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":"94ba1886-2624-4ec0-aaa5-4bfe04fddcf9","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.250115Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:4c7b90045f72c5e181a8940baae6fbdb1aeadaee68c8df0d0c4a0636abd73261","observation_id":"a8b1c143-4b83-49ea-bf47-4462a0fc4edb","resolution":{"observed_at":"2026-08-07T18:32:22.348188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.315916Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":"750ae84a-7fff-49c6-b197-601ca6cf3829","year":2020},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.259111Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:d56f4a06a4dffb8125de6abcc4e784bcfdd37fe5a49f401a714d76ddc55b74b2","observation_id":"8a4e59a3-d701-4d99-98be-dd44878199ec","resolution":{"observed_at":"2026-08-07T18:32:22.322709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.287503Z","title":"Enabling language models to implicitly learn self-improvement","venue":null,"work_id":"f1b89169-b221-4056-b1bb-261c2434b5fb","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.265704Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:e886b54a7b3aaada73999fb75df3cea22f271a6312a7354fdbf6e691c1a9c6bc","observation_id":"14b72f64-ca56-407f-aee4-3b0792b5404b","resolution":{"observed_at":"2026-08-07T18:32:22.297854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.256381Z","title":"Transforming and combining rewards for aligning large language models","venue":null,"work_id":"0ec3f090-c066-42ce-abfb-d9abd97246ca","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.273577Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:76096a486fb780d6497a4b4835fe2418d4c06472bbb79e28a69a3a472b5a3912","observation_id":"622b1c22-0d0e-4116-9b0c-ca6b54aefe74","resolution":{"observed_at":"2026-08-07T18:32:22.261958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.229294Z","title":"Policy gradient algorithms","venue":null,"work_id":"b58e5180-1e74-493b-83df-2fa24140ce78","year":2018},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.282655Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:1e42cf28be4bd09b40a34168ad2af31f06e25d1f9880bc2d850ced83b5e7d369","observation_id":"14cf1242-2bb1-4135-80d9-aa4b0aefe821","resolution":{"observed_at":"2026-08-07T18:32:22.238493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.190273Z","title":"V., Murray, K., and Kim, Y","venue":null,"work_id":"7c70d608-cad1-4d38-af7c-3e6a07ac401d","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.289186Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:0879ece7d6c46f4f59d5735f138929f734f49912439319d749c86a491b5a4188","observation_id":"74368c74-59ad-45f1-a388-e08c26b885b0","resolution":{"observed_at":"2026-08-07T18:32:22.201317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-06T05:33:43.589358Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T18:32:21.300233Z","title":"Some things are more cringe than others: Iterative preference optimization with the pairwise cringe loss, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.300233Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:3f91342b88dc592c96f84b0a8ced428869e599c345ce4c383a25a287a0391a8c","observation_id":"97ad70a4-9085-4d57-ad7e-f3d6738836c3","resolution":{"observed_at":"2026-08-07T18:32:21.300233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.168109Z","title":"Y., Cho, K., Sukhbaatar, S., Xu, J., and Weston, J","venue":null,"work_id":"90504695-47e9-40a1-82fe-0cbb6fff0a10","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.307867Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:cfe5b0861eba5d4cb96385e68cf1a3577283fefb2acc8c55b07018515445a383","observation_id":"00f98043-ba0a-4e26-a390-a345ade3e382","resolution":{"observed_at":"2026-08-07T18:32:22.175500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.136437Z","title":null,"venue":null,"work_id":"554f42ab-a71e-4066-a027-cd6aaf7fddd6","year":2023},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.312919Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:40c058031f3f738fb4705d8408a950adf7d7e4f6e9ae3c13dc7f9d14d7c9c58b","observation_id":"5e8863dd-e6f4-4a5c-8ebe-e6fde31070dd","resolution":{"observed_at":"2026-08-07T18:32:22.143704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.114099Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":"b63f88c1-3588-4a58-816a-06deb0ea6371","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.318779Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:6e4accbe919e73c12aaafa56e1310a48bc4de0fe4dd78b264f3ba8d44379346c","observation_id":"862eb67f-a726-4035-9669-b97892d90489","resolution":{"observed_at":"2026-08-07T18:32:22.120972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:22.090198Z","title":"I., and Jiao, J","venue":null,"work_id":"e8ea01dc-6cef-4c21-8afa-ac51dc04fb78","year":2024},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.325381Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:bbbff2016edfa1a3ce20bce600b3407c871d0c90112e8f82f07304da2fe59bdd","observation_id":"e9610168-ebbd-4b38-b0c3-8b7fab8f24bc","resolution":{"observed_at":"2026-08-07T18:32:22.100251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T18:32:21.331060Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T18:32:21.331060Z"},"links":{"citing_paper":"/paper/2502.10505"},"observation_digest":"sha256:3978a9a8a20f9fd515ca2747e90416f0c734419225a87faba1b0ff0d547dd46e","observation_id":"4419939a-a0f5-49a7-b640-ecc4d607b2e2","resolution":{"observed_at":"2026-08-07T18:32:21.331060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.10505","last_updated":"2025-07-26T17:40:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T08:55:43.184782Z","submitted_at":"2025-02-14T19:01:34Z","title":"Preference learning made easy: Everything should be understood through win rate"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":36},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2502.10505."}