{"as_of":"2026-08-19T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96446cd8260c5bc2ba43e9e7c89e014b63c3d6e9d1d809f2a8248d8334c6fdf9","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:27:11.573917Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:20:58.461665Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:36:40.511807Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04567","snapshot_observed_at":"2026-08-07T05:20:58.461665Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09086","last_updated":"2025-07-15T07:17:16Z","snapshot_observed_at":"2026-08-16T20:20:58.261179Z","submitted_at":"2025-06-10T08:45:15Z","title":"York's Cavity Formalism and Quantum Modified Thermodynamics of (2+1)D Black Holes","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:20:58.461665Z"},"links":{"cited_paper":"/paper/2502.04567","citing_paper":"/paper/2506.09086"},"observation_digest":"sha256:67cbea06152cc36383a8a4320b5a6024e22b4684d80ccf5841047217734a722f","observation_id":"8216cd18-29cc-4630-88ef-433fb7559ef1","resolution":{"observed_at":"2026-08-07T05:20:58.461665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"cited_work":{"arxiv_id":"2502.04567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04567","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.04567 , year=","venue":null,"work_id":"a5d690e0-8cac-4ebd-a95f-6f78db82c2de","year":2025},"citing_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T05:32:29.266583Z"},"links":{"cited_paper":"/paper/2502.04567","citing_paper":"/paper/2511.05271"},"observation_digest":"sha256:111ad354b2e5c5073137fd47873189d408ec768ae2fb1aeafa490178cf1d4106","observation_id":"268757a8-56ca-4ae9-bb86-dfe3e9422386","resolution":{"observed_at":"2026-05-16T05:32:29.524459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"cited_work":{"arxiv_id":"2502.04567","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04567","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2502.04567 , year=","venue":null,"work_id":"a5d690e0-8cac-4ebd-a95f-6f78db82c2de","year":2025},"citing_paper":{"arxiv_id":"2605.23043","last_updated":"2026-05-21T21:17:34Z","snapshot_observed_at":"2026-08-18T20:19:51.922074Z","submitted_at":"2026-05-21T21:17:34Z","title":"HawkesLLM: Semantic Uncertainty Propagation in Agentic Text Simulation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-25T05:30:37.320976Z"},"links":{"cited_paper":"/paper/2502.04567","citing_paper":"/paper/2605.23043"},"observation_digest":"sha256:1f1c441272f50e76e952558f43799d45e5a0a60461ca0261aa6eede10226a609","observation_id":"a4553154-f928-474f-9534-aa324d786347","resolution":{"observed_at":"2026-05-25T05:36:40.513620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04567/citation-record","integrity":"/paper/2502.04567/integrity","json":"/paper/2502.04567/citation-record.json","paper":"/paper/2502.04567"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.391147Z","title":"G., Guo, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.391147Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:3a33b8810e398045134d10220b0a34914d6a095ef5993af3b0dd75d364a3ae2f","observation_id":"09ff3f3f-553d-4098-9317-addc4c038319","resolution":{"observed_at":"2026-08-08T22:27:11.391147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.396046Z","title":"E., and Nocedal, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.396046Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:39f3d3c2d1a08dba3c1e6bbbac1bebe09644607b4c1d905ae732b4c697b3bfb5","observation_id":"b7f98236-acca-44d5-92ad-5d844804e912","resolution":{"observed_at":"2026-08-08T22:27:11.396046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.402075Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.402075Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:bb2faf90087bc188bf54b5ab44f73cb1054449858dc7786f63ac76ad8e4bdeda","observation_id":"5467d72f-8252-4146-b306-2a0d4123fe8a","resolution":{"observed_at":"2026-08-08T22:27:11.402075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:12.038224Z","title":"Noise contrastive alignment of language models with explicit rewards","venue":null,"work_id":"c563a7bb-2d2c-4706-b6a6-8fd25368fb69","year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.406347Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:1e575aee9da47fd40f5f4bfc25499376ae96bca0f51dc70887ba958f151fdcdb","observation_id":"b4898ca2-5e47-4c0f-a946-6fc3ac606d25","resolution":{"observed_at":"2026-08-08T22:27:12.042617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05875","last_updated":"2024-11-07T23:03:11Z","snapshot_observed_at":"2026-08-16T13:01:54.759507Z","submitted_at":"2024-11-07T23:03:11Z","title":"Towards Improved Preference Optimization Pipeline: from Data Generation to Budget-Controlled Regularization","version":1},"cited_work":{"arxiv_id":"2411.05875","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.05875","snapshot_observed_at":"2026-08-08T22:27:11.863693Z","title":"Towards Improved Preference Optimization Pipeline: from Data Generation to Budget-Controlled Regularization","venue":"cs.LG","work_id":"a9673a5d-a320-4667-b1de-07a0c9b14217","year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.411455Z"},"links":{"cited_paper":"/paper/2411.05875","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:308eb7533b10278fee97aac09fb965ccbe6c67aefb6bf560c17a9520220accb3","observation_id":"7346bb9c-6aa5-488e-b262-cc6f8f0b2e1b","resolution":{"observed_at":"2026-08-08T22:27:11.871651Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:12.024226Z","title":"Ultrafeedback: Boosting language models with high-quality feedback, 2024","venue":null,"work_id":"7adc8074-db2b-46f5-a5af-a06ab66d7258","year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.415943Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:64e12ea35dfda566bdddb1ee60e140b99dcb6bcb2e86895b327cc1fb567a3bc3","observation_id":"75cdeb0f-4ad1-4c10-984a-685cf5c4f2f1","resolution":{"observed_at":"2026-08-08T22:27:12.028948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:12.009584Z","title":"Anchored preference optimization and contrastive revisions: Addressing underspecification in alignment","venue":null,"work_id":"79822a2f-cbd4-4edf-b28f-e1366c32b430","year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.420602Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:66954270d62a98482de09c965a1db5ad009abfb7d730ba32cb1afa6ad974699a","observation_id":"c0d6ab18-1fa7-465d-b33f-6b2767e23a04","resolution":{"observed_at":"2026-08-08T22:27:12.014457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T22:27:11.424913Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.424913Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:07b98c14c20745ba33e6c3a4594432b1fa1d0fad55f3fa83716c1f580c01afc4","observation_id":"39445c87-3d7c-40dc-b8e9-7e36c312a16c","resolution":{"observed_at":"2026-08-08T22:27:11.424913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-08T22:27:11.429106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.429106Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:c86465ed0c4e03d09e7d087dc70983a611cff02ba7cc175f0e4b13239cecc445","observation_id":"dc34f322-dd1d-470a-bd37-86f452694010","resolution":{"observed_at":"2026-08-08T22:27:11.429106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-08T22:27:11.433240Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.433240Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:113553c788849b1970b832a792fe9fa93cbf36fae0e6e9408986469cff87be2e","observation_id":"88f3c83e-1990-48cd-94d2-8d307d1c65c6","resolution":{"observed_at":"2026-08-08T22:27:11.433240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.992733Z","title":"Aligning language models with preferences through f-divergence minimization","venue":null,"work_id":"da90dfb5-8bb1-431f-b672-568ec28b6f32","year":2023},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.437747Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:89d953124b53b36b002e443d6ba882f831ed5925cc294b108ddcf7428805eeb9","observation_id":"2dcb33f1-8483-413f-b250-8e4b0ab79b67","resolution":{"observed_at":"2026-08-08T22:27:11.998153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-16T14:20:38.839188Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-08T22:27:11.442396Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.442396Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:b64a75cae32bdae12c2e9ac866934330d9a6bfa5a79c9abac104aeeeb9c06cb5","observation_id":"35a8d537-a80e-4db4-a8d6-ec6e39ef4f5e","resolution":{"observed_at":"2026-08-08T22:27:11.442396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.446933Z","title":"and Hyv \\\"a rinen, A","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.446933Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:634d43215db4269b0ede4c9d78842cf13743b43f864a0830fda6dc54a92cf327","observation_id":"cc708a27-0e70-4be8-a02d-77803f193388","resolution":{"observed_at":"2026-08-08T22:27:11.446933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.450635Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.450635Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:b0b1bced0e31e7bcb339c4faa344ecebf56d9ef64e335d4bacfcdd2108808bb1","observation_id":"54e29e08-df1f-4a04-8eb8-4cd62e0c91e4","resolution":{"observed_at":"2026-08-08T22:27:11.450635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00856","last_updated":"2024-06-05T08:15:12Z","snapshot_observed_at":"2026-08-17T14:37:36.721385Z","submitted_at":"2024-02-01T18:51:54Z","title":"Towards Efficient Exact Optimization of Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00856","snapshot_observed_at":"2026-08-08T22:27:11.455229Z","title":"Towards efficient and exact optimization of language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.455229Z"},"links":{"cited_paper":"/paper/2402.00856","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:17ba2c43cea2b9662f517c12768a2bc28ef0a3a3fca7fd63ba6501a197536917","observation_id":"50f27505-97de-4b92-8df5-5e535e5f01c2","resolution":{"observed_at":"2026-08-08T22:27:11.455229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04656","last_updated":"2025-06-09T07:10:33Z","snapshot_observed_at":"2026-08-19T04:57:34.223598Z","submitted_at":"2024-04-06T15:20:59Z","title":"Binary Classifier Optimization for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04656","snapshot_observed_at":"2026-08-08T22:27:11.460376Z","title":"W., and On, K.-W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.460376Z"},"links":{"cited_paper":"/paper/2404.04656","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:c54d1dd743d05c914e78406d2a59be91e7b8d916a8de1ec2b63da1c2a11eca84","observation_id":"c4d54cf7-f402-4d13-b4fd-a5817cdb209c","resolution":{"observed_at":"2026-08-08T22:27:11.460376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.464975Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.464975Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:b496a413a46cdbe69072833d4f285cdd80c3d1a778ffa8e9185e8da655a59500","observation_id":"fbe46b0e-7036-44ba-9b12-059c391530f2","resolution":{"observed_at":"2026-08-08T22:27:11.464975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-08T22:27:11.469519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.469519Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:21349600a712cf06066a12c79e3c8d0931c207492e54628355a49e7cf66b51cf","observation_id":"f3b3714b-1694-452f-b7c2-092cb8ee9d0a","resolution":{"observed_at":"2026-08-08T22:27:11.469519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.955005Z","title":"E., and Stoica, I","venue":null,"work_id":"4be7dc43-fd8c-424b-8c77-500ad4cfe037","year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.474148Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:fdd14eea4263ef9b0245c0a97570af3d59abc6b7b2be2a279f32995b2c8e6fc4","observation_id":"05a7362e-cc12-45d8-a1cf-48eb939c46a1","resolution":{"observed_at":"2026-08-08T22:27:11.959427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-08-18T19:39:49.026410Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-08T22:27:11.479611Z","title":"Provably mitigating overoptimization in rlhf: Your sft loss is implicitly an adversarial regularizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.479611Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:0c6796916ba65bc39d1a188822acb7cec742cb4b8a5d944bb1818f15dfd307c3","observation_id":"df2d7f18-845b-4a78-b1e6-f792ebd39473","resolution":{"observed_at":"2026-08-08T22:27:11.479611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-08T22:27:11.484390Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.484390Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:d69510ce2c13537597c221f20a79b02a2fbeaef2e59d290a468d6b4b3baab58c","observation_id":"dad8a705-5d0e-4ce1-bad6-2c9cfea9a834","resolution":{"observed_at":"2026-08-08T22:27:11.484390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00640","last_updated":"2024-11-01T14:57:16Z","snapshot_observed_at":"2026-08-17T04:34:26.881993Z","submitted_at":"2024-11-01T14:57:16Z","title":"Adding Error Bars to Evals: A Statistical Approach to Language Model Evaluations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00640","snapshot_observed_at":"2026-08-08T22:27:11.489037Z","title":"Adding error bars to evals: A statistical approach to language model evaluations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.489037Z"},"links":{"cited_paper":"/paper/2411.00640","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:ebdb0d61c1b2a982025cb934a01027e32e8582054df1d66eb8ec1d49bb8a2b91","observation_id":"88278b66-2fb6-4044-b725-e202895d8152","resolution":{"observed_at":"2026-08-08T22:27:11.489037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.04797","last_updated":"2024-12-05T09:41:31Z","snapshot_observed_at":"2026-08-14T17:03:43.074753Z","submitted_at":"2019-03-12T09:28:05Z","title":"Elements of Sequential Monte Carlo","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.04797","snapshot_observed_at":"2026-08-08T22:27:11.494453Z","title":"A., Lindsten, F., and Schön, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.494453Z"},"links":{"cited_paper":"/paper/1903.04797","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:d25c52b7a3910de4462f01d511779a55b38b3d395d5a50121b2a4889a1811d30","observation_id":"0f9d9fca-3083-4181-b1cc-b7ffc7a440d3","resolution":{"observed_at":"2026-08-08T22:27:11.494453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.942099Z","title":"On the connection between noise-contrastive estimation and contrastive divergence","venue":null,"work_id":"d4980b04-6a78-4b36-a056-167232a67ea2","year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.499212Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:3fd26549206fc864d675f237741bc4c6eba8028e123b2d6e865893aaec5ca524","observation_id":"d44bc280-46d5-4d8a-a633-4e725dfccac6","resolution":{"observed_at":"2026-08-08T22:27:11.946431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.503738Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.503738Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:090df4d098d48bbc3850db60ad921d2af36db93a2e96638b9b8e297281408fe4","observation_id":"cc703708-848f-4776-9c6b-79de8ddd461e","resolution":{"observed_at":"2026-08-08T22:27:11.503738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-08T22:27:11.508003Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.508003Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:604b290654dc983320c941d737b3624a565a30e1a1c4406d08e276848b8247f3","observation_id":"4ad16160-6c38-41bd-bbcb-c7b5c618f451","resolution":{"observed_at":"2026-08-08T22:27:11.508003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.513501Z","title":"and Schaal, S","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.513501Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:df41e5fe15f3eb92afa0677304d5428e022a66a8460751778967a7d0fac5e377","observation_id":"667a8f3b-64e8-4391-a4af-d0f26ba1f572","resolution":{"observed_at":"2026-08-08T22:27:11.513501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-08-16T13:44:54.018719Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-08T22:27:11.518340Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.518340Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:c99bfd19b94a4e738e4e2aedfce39e976375bcf3b484495b67477ef2450c9d9a","observation_id":"14537d1c-3b73-45bc-a6d9-917caa9cc877","resolution":{"observed_at":"2026-08-08T22:27:11.518340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.523367Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.523367Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:0e15e4f1dc183761ce63cbd4f7243d0156b3c1e6ec2568e136275162d5cb382e","observation_id":"7d446647-df40-4f84-ba8e-3d50dc7770ad","resolution":{"observed_at":"2026-08-08T22:27:11.523367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-17T02:24:53.749690Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-08T22:27:11.528056Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.528056Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:6eb97902e6af3aa4ff4f53ff37201ab2deaf7f7681d7fe5a471b326df68bfd03","observation_id":"95964de6-65b9-4c72-a694-e5fa675a7a98","resolution":{"observed_at":"2026-08-08T22:27:11.528056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T22:27:11.533210Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.533210Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:40b0631271e0fa89777092cd835133a961cae55cee6ae310a2626bc83ce330c8","observation_id":"5e346559-95c2-4063-973b-b7676843897e","resolution":{"observed_at":"2026-08-08T22:27:11.533210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.904881Z","title":null,"venue":null,"work_id":"92464d85-df26-4c05-9409-8c134e91df27","year":2022},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.538375Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:b2bbca6faef33f22375c669e91c763bdf33ca116b3b9c8620cd987f88243f8c1","observation_id":"fc894399-ce8f-495a-af70-8e1f93fa99de","resolution":{"observed_at":"2026-08-08T22:27:11.909436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-08-16T13:52:52.945242Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-08-08T22:27:11.543782Z","title":"Z., Zheng, Z., Calandriello, D., Cao, Y., Tarassov, E., Munos, R., Pires, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.543782Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:32abba29a151d477727dac41841cf509c43a66ae1175bff69354bb79f80dd31f","observation_id":"b788fd2a-d719-4b25-9826-3906610d7ff4","resolution":{"observed_at":"2026-08-08T22:27:11.543782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-08-18T22:05:54.705341Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-08T22:27:11.549336Z","title":"Zephyr: Direct distillation of lm alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.549336Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:dcce98bdd6370a8a47dda51a4839f47f3ac5fab49b7662246fd1b9c5a82238e0","observation_id":"94169a91-f4f2-4441-9332-0d867585e7bf","resolution":{"observed_at":"2026-08-08T22:27:11.549336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-08-17T14:38:33.496197Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-08T22:27:11.555427Z","title":"Self-play preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.555427Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:66b311e836f9474acae205565b26da7e35709bff960f7f5e9a00c7a16028fe99","observation_id":"30a80611-c1ba-4d9f-8571-f9768e024683","resolution":{"observed_at":"2026-08-08T22:27:11.555427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-16T14:27:06.094079Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-08T22:27:11.560059Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.560059Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:21a105ed2c3c2ac445ead73f5e6854c8a4989e31cb437acc776ccecae5a3cca2","observation_id":"23606bc7-2505-4ebd-8220-6702321e2409","resolution":{"observed_at":"2026-08-08T22:27:11.560059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.891056Z","title":"Starling-7b: Improving llm helpfulness & harmlessness with rlaif, 2023","venue":null,"work_id":"312d98c2-afc6-4698-b00d-07bdf9f0cd9a","year":2023},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.564541Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:e316d65030059d8bb7430c65d105c43262461279d2c49a3c3ebed07ca668e66a","observation_id":"88fccbc1-22cf-488e-b8fb-5bc9d8170d15","resolution":{"observed_at":"2026-08-08T22:27:11.895232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-08T22:27:11.569074Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.569074Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:547d8a8089312051521502fd36a6913b180821f0308ba13ba342d62043348712","observation_id":"e9d8cecb-6904-4a76-be1a-5d3f8f3a8008","resolution":{"observed_at":"2026-08-08T22:27:11.569074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:27:11.573917Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.573917Z"},"links":{"citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:6e8249d0681613a5feb3b5a7f016fc45f5d32a3f9d7ce532633dcb882e032a39","observation_id":"5528dc08-a4d6-48f8-9b59-19331eba3f92","resolution":{"observed_at":"2026-08-08T22:27:11.573917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T22:29:37.504764Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2502.04567."}