{"as_of":"2026-08-14T16:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d30042edc1cb8372e87aafc684e66911b5f7b0f4596d74a8b33534c9a77e871","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:16:32.070018Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:17:46.012360Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T04:42:04.899091Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14516","snapshot_observed_at":"2026-08-08T12:17:46.012360Z","title":"Cal-dpo: Calibrated direct preference optimization for language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07599","last_updated":"2025-06-06T11:18:28Z","snapshot_observed_at":"2026-08-14T07:34:52.037963Z","submitted_at":"2025-02-11T14:49:44Z","title":"DPO-Shift: Shifting the Distribution of Direct Preference Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:17:46.012360Z"},"links":{"cited_paper":"/paper/2412.14516","citing_paper":"/paper/2502.07599"},"observation_digest":"sha256:b54f2024673d40328d7bfc986ce0f14d6c83ecf4ff3704b99f778bad687e88cb","observation_id":"5983e2f6-f1c3-49aa-999c-9598cfd3d96f","resolution":{"observed_at":"2026-08-08T12:17:46.012360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"cited_work":{"arxiv_id":"2412.14516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14516","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"087dde41-7822-4206-a07c-a182f11003bc","year":2024},"citing_paper":{"arxiv_id":"2507.10722","last_updated":"2026-04-10T03:29:37Z","snapshot_observed_at":"2026-08-14T05:07:46.980450Z","submitted_at":"2025-07-14T18:43:05Z","title":"Bridging Brains and Machines: A Unified Frontier in Neuroscience, Artificial Intelligence, and Neuromorphic Systems","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-05-19T04:37:33.928616Z"},"links":{"cited_paper":"/paper/2412.14516","citing_paper":"/paper/2507.10722"},"observation_digest":"sha256:f1074c21f4b51e1f3ed5e4be7220b2533574d248497d7c599bfffae3e0f6b2dc","observation_id":"4b664141-2b19-4be9-bc82-8fb1de2a8e68","resolution":{"observed_at":"2026-05-19T04:42:04.901351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"cited_work":{"arxiv_id":"2412.14516","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.14516","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"087dde41-7822-4206-a07c-a182f11003bc","year":2024},"citing_paper":{"arxiv_id":"2605.02626","last_updated":"2026-05-04T14:15:24Z","snapshot_observed_at":"2026-08-14T12:15:41.778719Z","submitted_at":"2026-05-04T14:15:24Z","title":"Gradient-Gated DPO: Stabilizing Preference Optimization in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T18:35:13.659698Z"},"links":{"cited_paper":"/paper/2412.14516","citing_paper":"/paper/2605.02626"},"observation_digest":"sha256:2328690398a370618fef0c329a824146eb6f4986aa3660b70d64b93eb39a354d","observation_id":"10e735fa-5805-42b3-a9da-57eff2c8f526","resolution":{"observed_at":"2026-05-09T06:20:41.691864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14516/citation-record","integrity":"/paper/2412.14516/integrity","json":"/paper/2412.14516/citation-record.json","paper":"/paper/2412.14516"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-11T12:16:31.787908Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.787908Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:94e2e4979acbc01386b7404233e5ba28f5b911d997fc6ed7b1350ef0ffca8766","observation_id":"a3043f17-7c1a-4907-9627-c1f5b1960ec7","resolution":{"observed_at":"2026-08-11T12:16:31.787908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.792312Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.792312Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:57b0c42e725707b5362c72cadb23b28bca42a4441273dae42217730a087b07a2","observation_id":"7a53bf06-8323-4cfd-805a-41592a79ce75","resolution":{"observed_at":"2026-08-11T12:16:31.792312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.795485Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.795485Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:5f7e7a1642a5c53724928d3e9e1b0ccaf86e4db4c9ab26415b25391a592f9d80","observation_id":"f1c5331e-62a6-4b14-8f7e-9d06a1242baf","resolution":{"observed_at":"2026-08-11T12:16:31.795485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.798253Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.798253Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2ca6c3728eba49ab08fdc38fe73bdbe2bfba2f3b26663066cddb79a7e770e028","observation_id":"c21db7c7-e901-4ace-aa9d-f03d596f7616","resolution":{"observed_at":"2026-08-11T12:16:31.798253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T12:16:31.800935Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.800935Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:56cc84c0b3f62fc393b4086f22256c5e256b6a57a3b41fd14d7142f7248cbb39","observation_id":"4ab6c605-1107-4c47-ba23-174ba61bb750","resolution":{"observed_at":"2026-08-11T12:16:31.800935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.805323Z","title":"Implementation matters in deep policy gradients: A case study on ppo and trpo","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.805323Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e3a0b1161ee2adb3b10b3bb500abd682e9f572ca873afb08fac7b86b525a8390","observation_id":"c2e03700-8331-4b9a-9237-0832dace122f","resolution":{"observed_at":"2026-08-11T12:16:31.805323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.809910Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.809910Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2e15252ec888da4d7bde4d4f3b4b1f4d3926bc3b86ff87643f25d455efc25064","observation_id":"c8364072-296c-4bfa-9f37-7b5b687dd2c0","resolution":{"observed_at":"2026-08-11T12:16:31.809910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.813699Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.813699Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d9a4ae6eaab17919f6961e467e1783bddc50776ed9d5cfb52b50a5a3ed8f5fd4","observation_id":"de430066-de2d-42a1-aab7-fe0e94031552","resolution":{"observed_at":"2026-08-11T12:16:31.813699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-13T11:40:02.795309Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-11T12:16:31.816513Z","title":"Slic- hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.816513Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:6e889723e63fdeab1e88c7a69a1ba8e44988bb5610bea97b5506464c58a4f7ea","observation_id":"252bde81-682b-48cd-b034-cb66fe3413f1","resolution":{"observed_at":"2026-08-11T12:16:31.816513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14367","last_updated":"2024-06-02T22:00:42Z","snapshot_observed_at":"2026-08-13T06:40:27.614915Z","submitted_at":"2024-04-22T17:20:18Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14367","snapshot_observed_at":"2026-08-11T12:16:31.820225Z","title":"Preference fine-tuning of llms should leverage suboptimal, on-policy data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.820225Z"},"links":{"cited_paper":"/paper/2404.14367","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:5af7b01f5c927fa92c8c0e93d2d0c0669f87505153603206cf954dde6e495cdf","observation_id":"1260564c-4074-4593-9df5-ec7ae10168ed","resolution":{"observed_at":"2026-08-11T12:16:31.820225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-11T12:16:31.823443Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.823443Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:165e25034ca0b61145ddc9cf7b67a6804304f8e5c8855426ed4dec5332ba4c8c","observation_id":"d69ef4d6-85ad-494f-a7e1-c9a4554f450f","resolution":{"observed_at":"2026-08-11T12:16:31.823443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-13T00:39:09.051530Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-11T12:16:31.827786Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.827786Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:efe1a722c950893dde6453833245e0d714d839c13f1c746c64e80eba813d6358","observation_id":"99b3e0ae-f37d-4861-986f-cdd089439c71","resolution":{"observed_at":"2026-08-11T12:16:31.827786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.831179Z","title":"Learning word vectors for sentiment analysis","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.831179Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:3c13b34a437f320554cf0fec4c1e82806f3c58feb3ce7706eae53154e1da690b","observation_id":"6796dcc0-2ce7-4394-805f-483abf14982d","resolution":{"observed_at":"2026-08-11T12:16:31.831179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.709103Z","title":"Tl; dr: Mining reddit to learn automatic summarization","venue":null,"work_id":"e037d705-ca31-43b1-952e-35e912ec4e00","year":2017},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.834698Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:c899e0b8b080eaf5a0bdfe8874ec82bc7f3386ea0acc6ab6206ace9e647f821f","observation_id":"4cd60717-3a3a-459c-8c01-687001bbea5c","resolution":{"observed_at":"2026-08-11T12:16:32.711917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.838747Z","title":"A framework for few-shot language model evaluation, 12 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.838747Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:7cbcd81f6c93359facd0ee2c6803a90670f827784464fa5c7a2f1e52ef904312","observation_id":"edadd08e-1c6a-43ed-998e-18509afea875","resolution":{"observed_at":"2026-08-11T12:16:31.838747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00886","last_updated":"2024-06-11T16:25:52Z","snapshot_observed_at":"2026-08-13T05:12:12.105399Z","submitted_at":"2023-12-01T19:26:23Z","title":"Nash Learning from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00886","snapshot_observed_at":"2026-08-11T12:16:31.841413Z","title":"Nash learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.841413Z"},"links":{"cited_paper":"/paper/2312.00886","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d9b1a645e52bbce8bf27b21e926acb475fe90ade299732f9cbc1cc405af146f7","observation_id":"65c40c16-36fe-473b-ad35-f090bd37ad5b","resolution":{"observed_at":"2026-08-11T12:16:31.841413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.697595Z","title":"Statistical rejection sampling improves preference optimization","venue":null,"work_id":"e75a1369-d0ab-4df0-b50f-2f083c71460f","year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.844889Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:a9bd99203f0371332e4dad07ac43d9715685331d7ee2e2785d36e84017a881cf","observation_id":"ec0e0994-acd2-4e42-a38b-9f8c176824b2","resolution":{"observed_at":"2026-08-11T12:16:32.700617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-07T08:02:34.857823Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-11T12:16:31.847944Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.847944Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ffaa6b84500ff5f59b4f6b18d4b96f1d038c4352339675269c2d4f2490997cd9","observation_id":"70cce962-625c-40dd-ad7e-be59950a25ca","resolution":{"observed_at":"2026-08-11T12:16:31.847944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-13T04:59:12.838781Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-08-11T12:16:31.851281Z","title":"Gibbs sam- pling from human feedback: A provable kl-constrained framework for rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.851281Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d51b7ed2008e68a93a9d43be09a095aaa4406e0d13f7716f90d829e2c8847629","observation_id":"0762ebe0-d00d-443c-ba4f-58f67230247e","resolution":{"observed_at":"2026-08-11T12:16:31.851281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-14T12:56:25.698035Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-11T12:16:31.855210Z","title":"Direct nash optimization: Teaching language models to self-improve with general preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.855210Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:b7838044d992db7bd987cd1ca1bc6c7b8116848fc1de0363cae8d79fa46a08b6","observation_id":"6819dafb-6643-4018-b926-430f6136ac17","resolution":{"observed_at":"2026-08-11T12:16:31.855210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-14T00:12:09.918230Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-11T12:16:31.859337Z","title":"Direct language model alignment from online ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.859337Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:aa25bee19b57afa455d190f3e23a91ceb1fb6f67dfa94adf8e6c41b8050b7a84","observation_id":"087d7327-30ac-4fe0-9c68-53e750be321b","resolution":{"observed_at":"2026-08-11T12:16:31.859337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.689967Z","title":"Simper: Simple preference fine-tuning without hyperparameters by perplexity optimization","venue":null,"work_id":"4d6ffea0-c70f-440e-ab31-dd5db206663d","year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.863229Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:4cc1c842cc7b0b666bf8eb599057ac11bb9c1904f43021f9a6d818d679d80699","observation_id":"a7690f04-8146-4675-90d9-319bb5331e75","resolution":{"observed_at":"2026-08-11T12:16:32.693022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10584","last_updated":"2024-02-25T19:15:26Z","snapshot_observed_at":"2026-08-13T05:00:13.831621Z","submitted_at":"2023-12-17T02:14:15Z","title":"Policy Optimization in RLHF: The Impact of Out-of-preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10584","snapshot_observed_at":"2026-08-11T12:16:31.865955Z","title":"Policy optimization in rlhf: The impact of out-of-preference data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.865955Z"},"links":{"cited_paper":"/paper/2312.10584","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:acfa96f959ea8902ad6ea21883cc941a8066ba2328e71595995bc62865e67ac1","observation_id":"07476bde-f31a-476d-8daa-12c33e203891","resolution":{"observed_at":"2026-08-11T12:16:31.865955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-08-13T06:40:10.732455Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-11T12:16:31.868865Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study.arXiv preprint arXiv:2404.10719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.868865Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:db6a99c81f817acab354ae218200f6787fe527245005ffd7c03e4bede1b08010","observation_id":"f3207bb2-2819-4a05-88bf-8338026d52c2","resolution":{"observed_at":"2026-08-11T12:16:31.868865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00409","last_updated":"2024-04-12T01:09:37Z","snapshot_observed_at":"2026-08-14T11:34:26.521814Z","submitted_at":"2024-03-01T09:55:18Z","title":"Provably Robust DPO: Aligning Language Models with Noisy Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00409","snapshot_observed_at":"2026-08-11T12:16:31.872076Z","title":"Provably robust dpo: Aligning language models with noisy feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.872076Z"},"links":{"cited_paper":"/paper/2403.00409","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d4661e9111c53a6cd1a39b7ca4e419d4275cfe7cc068506e5abdb108a03649ce","observation_id":"00fe9418-3368-48a4-9310-8b5c3d35de57","resolution":{"observed_at":"2026-08-11T12:16:31.872076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05369","last_updated":"2024-10-30T07:29:40Z","snapshot_observed_at":"2026-08-13T04:23:44.814807Z","submitted_at":"2024-02-08T02:58:47Z","title":"Noise Contrastive Alignment of Language Models with Explicit Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05369","snapshot_observed_at":"2026-08-11T12:16:31.875936Z","title":"Noise contrastive alignment of language models with explicit rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.875936Z"},"links":{"cited_paper":"/paper/2402.05369","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:dbc8ec82c8a383254cf8e08474df5cf6da9de7921a6846fc502a2a637d823c43","observation_id":"c89ca9c3-a17a-4814-871d-11c438522a3a","resolution":{"observed_at":"2026-08-11T12:16:31.875936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14228","last_updated":"2024-12-21T02:55:16Z","snapshot_observed_at":"2026-07-06T17:33:45.647306Z","submitted_at":"2024-02-22T02:20:08Z","title":"COPR: Continual Human Preference Learning via Optimal Policy Regularization","version":3},"cited_work":{"arxiv_id":"2402.14228","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14228","snapshot_observed_at":"2026-08-11T12:16:32.250860Z","title":"COPR: Continual Human Preference Learning via Optimal Policy Regularization","venue":"cs.LG","work_id":"fa84e49d-f13b-4e28-a061-ff664daaefc9","year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.879139Z"},"links":{"cited_paper":"/paper/2402.14228","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d53708980852c163636aeeb78673eb44e6a1cbf16d578c954bdc64e7ab58c096","observation_id":"4960576a-471c-4581-801a-9b1107e24467","resolution":{"observed_at":"2026-08-11T12:16:32.256071Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00856","last_updated":"2024-06-05T08:15:12Z","snapshot_observed_at":"2026-08-13T04:28:58.806092Z","submitted_at":"2024-02-01T18:51:54Z","title":"Towards Efficient Exact Optimization of Language Model Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00856","snapshot_observed_at":"2026-08-11T12:16:31.882201Z","title":"Towards efficient and exact optimization of language model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.882201Z"},"links":{"cited_paper":"/paper/2402.00856","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:555f4633cab9db023c6a5c84cf43e48bca056f23b384e81bed43a2bf647360a7","observation_id":"c4044b74-173e-4ab9-8a56-2590f91da535","resolution":{"observed_at":"2026-08-11T12:16:31.882201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.680913Z","title":"Noise contrastive estimation and negative sampling for condi- tional models: Consistency and statistical efficiency","venue":null,"work_id":"8327fc4d-5e56-41e3-998f-5c30e04a38f4","year":2018},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.885458Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:3f5c1f4f4b9dfa09e0491439e3812ca38b9a8749ecf1fcf30991e991f433b049","observation_id":"793ac3b3-1a83-4aea-9f02-c5230f473f25","resolution":{"observed_at":"2026-08-11T12:16:32.684069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04626","last_updated":"2024-04-06T13:24:37Z","snapshot_observed_at":"2026-08-13T00:35:56.015163Z","submitted_at":"2024-04-06T13:24:37Z","title":"Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04626","snapshot_observed_at":"2026-08-11T12:16:31.888937Z","title":"Towards ana- lyzing and understanding the limitations of dpo: A theoretical perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.888937Z"},"links":{"cited_paper":"/paper/2404.04626","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:0c189529f2a313a9ba41d0074953adb0fcb55310ee326f1fa8e01083330ff624","observation_id":"ea2b61fe-61ac-47a8-9026-a9ad5900318c","resolution":{"observed_at":"2026-08-11T12:16:31.888937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-08-13T00:27:12.618680Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-11T12:16:31.891745Z","title":"From r to q*: Your language model is secretly a q-function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.891745Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:7b835c6f18fada763a933a3be3583f3969b3fe05438bdc97325a57d4c1e4cda3","observation_id":"53babd5a-45e5-4f9d-8b08-949cb10d1c75","resolution":{"observed_at":"2026-08-11T12:16:31.891745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-08-13T00:19:13.755361Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-11T12:16:31.895081Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.895081Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:c8751d62b48629bc7a8f637fae87a4382c83e85d5a01091240651401a7b5f2fa","observation_id":"f4659949-2b58-4b5b-8532-ade787f3a012","resolution":{"observed_at":"2026-08-11T12:16:31.895081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-14T11:44:20.607461Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-11T12:16:31.898358Z","title":"Token- level direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.898358Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:36e63f6a26340a67918e3ae7112de2258966803b9b3559e0cd6ed439533b83b4","observation_id":"df554fa1-4c4e-4e47-8839-3d33f48fea7a","resolution":{"observed_at":"2026-08-11T12:16:31.898358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.671098Z","title":"A general offline reinforcement learning framework for interac- tive recommendation","venue":null,"work_id":"e2a718cb-77d9-42fa-9367-42c3fd06246e","year":2021},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.903506Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:94be9ff6e3b878580d7c69e215e46563acae8ec4be2c99684625a1f1a37084e0","observation_id":"1343b00a-f14a-4d03-ae9d-80f0692c6f1a","resolution":{"observed_at":"2026-08-11T12:16:32.674683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.661404Z","title":"On calibration of modern neural networks","venue":null,"work_id":"ed14f18e-7a9b-4833-9ae9-6177fe988d1b","year":2017},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.906673Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2438acce3ef158b0827e4088664be80594cace3f393ff742faa9a2c86be641df","observation_id":"6f6fb95b-bc85-4058-9a5f-7997b2df7c71","resolution":{"observed_at":"2026-08-11T12:16:32.664634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.652354Z","title":"Scale calibration of deep ranking models","venue":null,"work_id":"b82e1b71-970c-47cd-9790-fc050896914f","year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.910137Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:a05615485782dd84cf1c2497bbef7de095f8e7912b3813779403663b0bcbef52","observation_id":"64781a79-dc7c-4d9e-82a9-962a674930b6","resolution":{"observed_at":"2026-08-11T12:16:32.655401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.642018Z","title":"Calibrated model-based deep reinforcement learning","venue":null,"work_id":"5df55a62-72f7-4d12-9e8e-d1b8fe5c7396","year":2019},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.912682Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:dfab3e7b42c8d057f740821eb5a2c0d312b05c47cc78bcaa040d37d723199392","observation_id":"dfdcb30e-710b-4eb5-9e07-495b1f6bcc7d","resolution":{"observed_at":"2026-08-11T12:16:32.646066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.916373Z","title":"Cal-ql: Calibrated offline rl pre-training for efficient online fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.916373Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:f606446bb98acd2fa63a1a7e0af5384a3d53719593ae455b0ea99cb5f0744624","observation_id":"5714eafd-90fb-415e-b599-e941e60eb9b0","resolution":{"observed_at":"2026-08-11T12:16:31.916373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13240","last_updated":"2023-11-22T08:57:55Z","snapshot_observed_at":"2026-08-13T05:19:50.469051Z","submitted_at":"2023-11-22T08:57:55Z","title":"On the Calibration of Large Language Models and Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13240","snapshot_observed_at":"2026-08-11T12:16:31.919947Z","title":"On the calibration of large language models and alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.919947Z"},"links":{"cited_paper":"/paper/2311.13240","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:6d8ec4eaa3f4b5c343b67388c2f8446611c40196310384a7f9d258b523214452","observation_id":"8437b2c8-1af5-4ddd-9ab1-d93fa3439987","resolution":{"observed_at":"2026-08-11T12:16:31.919947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-11T12:16:31.922990Z","title":"Language models (mostly) know what they know","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.922990Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2826a00bff271fffaa31439c9445e67d68c334ed9faadc8ee8eb9f54eeff915e","observation_id":"9312365d-b111-474d-b068-e16fa8b1bee6","resolution":{"observed_at":"2026-08-11T12:16:31.922990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.628116Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"45229159-a8bf-4b74-90e8-3cae9eb69e1b","year":1952},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.927134Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:92344c33153782e8aebab45b1b8988f7f2e607fb69b27e7f6511b5e62aaf18ce","observation_id":"56d76232-f930-4dd0-af5b-52442956b335","resolution":{"observed_at":"2026-08-11T12:16:32.631213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-08-13T04:23:18.212697Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-11T12:16:31.930130Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.930130Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:28ecd813693b43fc978adbabf9373fe76ce1a2b3eb7225947c138be075186942","observation_id":"83463c92-b4e6-4ccd-8540-2d4bb110ed37","resolution":{"observed_at":"2026-08-11T12:16:31.930130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10093","last_updated":"2024-10-14T02:21:29Z","snapshot_observed_at":"2026-08-14T10:47:06.359964Z","submitted_at":"2024-10-14T02:21:29Z","title":"How to Leverage Demonstration Data in Alignment for Large Language Model? A Self-Imitation Learning Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10093","snapshot_observed_at":"2026-08-11T12:16:31.933188Z","title":"How to leverage demonstration data in alignment for large language model? a self-imitation learning perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.933188Z"},"links":{"cited_paper":"/paper/2410.10093","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:9c81e33597633ad7c6488f51813cfdc5f92ad654b415deb59f314e856cfce292","observation_id":"a4256de8-453d-45da-95c8-e554d4f05985","resolution":{"observed_at":"2026-08-11T12:16:31.933188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T23:59:40.308872Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-11T12:16:31.937213Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.937213Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:633c390546f0aec9a5e15c3dcd0fb8cefb31740bd2c3982e3adb1b61b2ca5c41","observation_id":"0943c1fb-e0db-48ed-9cf5-9f167b4771ef","resolution":{"observed_at":"2026-08-11T12:16:31.937213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-08-13T14:38:32.919809Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-11T12:16:31.940300Z","title":"Reinforced self-training (rest) for language modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.940300Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:38543aadc657d573736726395260e0ac9aa24535e9fad664a49a6b860388f7bf","observation_id":"ac1a2811-daad-4d69-bb65-a0193be5fac8","resolution":{"observed_at":"2026-08-11T12:16:31.940300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.617364Z","title":"Openchat: Advancing open-source language models with mixed-quality data","venue":null,"work_id":"4156544d-50f9-440b-b344-8b1bb8bc1419","year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.944005Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:3c9cf359f6c8a2d7299aece7fa70221fe60d44ed2d59e30a6936888ffc4bc465","observation_id":"25e9db84-767a-48ea-b70d-e03cd68fe5a9","resolution":{"observed_at":"2026-08-11T12:16:32.621160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02231","last_updated":"2023-11-02T22:47:14Z","snapshot_observed_at":"2026-08-13T11:25:01.935241Z","submitted_at":"2023-06-04T01:59:40Z","title":"Fine-Tuning Language Models with Advantage-Induced Policy Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02231","snapshot_observed_at":"2026-08-11T12:16:31.947063Z","title":"Fine-tuning language models with advantage-induced policy alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.947063Z"},"links":{"cited_paper":"/paper/2306.02231","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:b42d873f00fbfda4ffb99cfb3dc0bc99a7c9fc73ccbd061aaadaee6ec3747f6a","observation_id":"84b5bfc4-f444-45dd-ac05-f508bab73996","resolution":{"observed_at":"2026-08-11T12:16:31.947063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.949861Z","title":"Machine learning: a probabilistic perspective","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.949861Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:009ce0b68802bc7297049a399fcbe97eedf0bfddcba920e55398c594401e48cd","observation_id":"fa582487-b8bf-4e08-9c55-7a73db68d3b8","resolution":{"observed_at":"2026-08-11T12:16:31.949861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09321","last_updated":"2017-03-15T22:55:17Z","snapshot_observed_at":"2026-08-12T04:36:10.372729Z","submitted_at":"2016-11-28T20:15:55Z","title":"Improving Policy Gradient by Exploring Under-appreciated Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09321","snapshot_observed_at":"2026-08-11T12:16:31.952713Z","title":"Improving policy gradient by exploring under-appreciated rewards","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.952713Z"},"links":{"cited_paper":"/paper/1611.09321","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:64890aa83c0ab84415c1f56b1a6e065746c57c466be5e151f0e5705ab09f487e","observation_id":"42d83879-5ccc-4995-84eb-62af187d97d4","resolution":{"observed_at":"2026-08-11T12:16:31.952713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.599138Z","title":"Learning how to propagate messages in graph neural networks","venue":null,"work_id":"e8f2c603-ee28-436d-9170-4759a3b08d9d","year":1903},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.956300Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:86fa5b0782d23a7e998291d01294ec6b4f4d2127b14a075f3bce10d7ab53b443","observation_id":"2a03ab81-e9a4-4ed8-a15e-156dba954253","resolution":{"observed_at":"2026-08-11T12:16:32.602814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.588571Z","title":"Learning to generalize from sparse and underspecified rewards","venue":null,"work_id":"68c838a6-8fd5-4593-8aef-07e268805173","year":2019},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.958843Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:74b861b09340966ef08b1ae18584ce0a8410b872c55272ccc06c6b52fa85512e","observation_id":"00ecfb45-e50e-47c1-b8fa-c9e7af06eb87","resolution":{"observed_at":"2026-08-11T12:16:32.591645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.578266Z","title":"Decoupled self-supervised learning for graphs","venue":null,"work_id":"b5392fd2-e079-45ea-8c90-f8b28e0fec70","year":2022},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.961637Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:6c82f39c8ca8e4e192a8ffea535c1d2eea2987cf88205e639fe4815acf60f543","observation_id":"f71633dc-4925-4aad-8ec1-3b59b4422e85","resolution":{"observed_at":"2026-08-11T12:16:32.581460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-11T12:16:31.964333Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.964333Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:ed52aec3fcbfe24298c36df3b53f2296f348db771367b73b79b55a685794afc9","observation_id":"f57ea6f7-d3af-4c71-b8aa-df3d3e2ac0ef","resolution":{"observed_at":"2026-08-11T12:16:31.964333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-11T12:16:31.967147Z","title":"Zephyr: Direct distillation of lm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.967147Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:0405aa091a21dc5bca23762ea76dee2dc2d4c6e7c021d29b6d1ad05ec3aaacf3","observation_id":"5a888593-3615-4760-a93b-621af2650ef9","resolution":{"observed_at":"2026-08-11T12:16:31.967147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-11T12:16:31.970515Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.970515Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:a0da2fbd52ca6187e4554deefe512d756c47ec4873b8ad53142d58d47937be2b","observation_id":"8842ab19-1cfe-4140-910d-d92946430a09","resolution":{"observed_at":"2026-08-11T12:16:31.970515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-11T12:16:31.973598Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.973598Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:4fba998b889ede45ad6e21657dedb705b9364f8bd029387112bf9cd46b64adbf","observation_id":"8a528a66-0fca-47d9-91f4-689ff083e0ae","resolution":{"observed_at":"2026-08-11T12:16:31.973598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-11T12:16:31.977059Z","title":"Instruction-following evaluation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.977059Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e356c7c0ac2019b89e76198d81e0a704dc32cd3266801bdd8c2b9b8963a8d9f3","observation_id":"53e1e8af-cde6-4422-ac5d-4e030c0db960","resolution":{"observed_at":"2026-08-11T12:16:31.977059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-11T12:16:31.980152Z","title":"Challenging big- bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.980152Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:792a6792cf642ca63204caae96824af5820a3db2ea43b5887a92ac72f4ce7153","observation_id":"38d0ece0-5b9d-4acd-89ef-12140dc30d40","resolution":{"observed_at":"2026-08-11T12:16:31.980152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-11T12:16:31.983210Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.983210Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:33294ed5a3faa55f59b33857085c66702ec97be4c6ee350245bff26172648e38","observation_id":"9f242457-b2f7-4380-9e7b-3bcb877d3602","resolution":{"observed_at":"2026-08-11T12:16:31.983210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-11T12:16:31.986326Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.986326Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:179c325feda37ffa9fa45558950204ab0b4faa7faa0b255e33614a809f2a58d3","observation_id":"085c13ee-d299-423b-b2c1-408a20437e10","resolution":{"observed_at":"2026-08-11T12:16:31.986326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-11T12:16:31.989194Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.989194Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:d31aa1f4467b4ceb8f69baf88911a1669d26d8b5a664f15df3325be0a6204be5","observation_id":"f68d5328-0d1d-41ed-86d2-480ad6135bdf","resolution":{"observed_at":"2026-08-11T12:16:31.989194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.991750Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.991750Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:7a8681e437b7e7d7e29d79ad12ff7eeab938bc400e06a59e79a1d2d8f398bba0","observation_id":"959e2286-93db-4f1d-bf5b-cc7288c8181c","resolution":{"observed_at":"2026-08-11T12:16:31.991750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:31.994540Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.994540Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:3ce90d70e66edf5dae8714eefc4cabd982712d09f46e0b6ebc7a404fcd800d4c","observation_id":"b5c75b4a-1225-4dd4-bbf8-58a1b9a2280f","resolution":{"observed_at":"2026-08-11T12:16:31.994540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.555220Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d7142039-0935-4be5-ae26-203e146c0527","year":2019},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.997113Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:193bb0d85bd47cb801935a441abe8938c233de4aaa252b4a619d100365ea0a8b","observation_id":"3eecb998-3173-402e-b8d0-ea74583ca919","resolution":{"observed_at":"2026-08-11T12:16:32.559450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-13T04:41:57.988720Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-11T12:16:31.999493Z","title":"Contrastive preference optimization: Pushing the boundaries of llm performance in machine translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.999493Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:36cdb78d962f29e4d67afacd3c1588cc84b766160cfa411eb4c592e1d80caaee","observation_id":"d2f9f718-aa82-40fd-96c9-61af13d31330","resolution":{"observed_at":"2026-08-11T12:16:31.999493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.545897Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":null,"work_id":"c98d81b9-6aea-4c02-bcb8-bbb945654ec9","year":2023},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.003524Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2a5c8c8f33405af877e80b5dbc3ae647b165e9eed1c2946360d58e8b222c2b4d","observation_id":"dc65e0f0-fbbf-4f39-a91c-6616e4399414","resolution":{"observed_at":"2026-08-11T12:16:32.549991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19733","last_updated":"2024-06-26T01:28:35Z","snapshot_observed_at":"2026-08-14T14:26:01.801451Z","submitted_at":"2024-04-30T17:28:05Z","title":"Iterative Reasoning Preference Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19733","snapshot_observed_at":"2026-08-11T12:16:32.006296Z","title":"Iterative reasoning preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.006296Z"},"links":{"cited_paper":"/paper/2404.19733","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2b94842d37da5fa068533b41a04c2286b4ce1c5011a94f1906ada269026938c3","observation_id":"650830fe-ea77-4a4c-b4dd-a0dc74095e6d","resolution":{"observed_at":"2026-08-11T12:16:32.006296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.537004Z","title":"Information, divergence and risk for binary experiments","venue":null,"work_id":"4a9a5fd8-edf4-4a36-82c1-4c0486bfd0f3","year":2011},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.010038Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:95c7e0685bdb7816c274635eec6722df16b27cd489b02aaceb9d775bbecf3786","observation_id":"33bd544e-d5b4-4168-b0a0-581e3d3d6058","resolution":{"observed_at":"2026-08-11T12:16:32.540757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.527105Z","title":"Reward augmented maximum likelihood for neural structured prediction","venue":null,"work_id":"112a29a2-6e77-41c4-8afe-973b80f4841f","year":2016},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.012829Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2676865473d2d5e5c473f8e8023b5173d0e6ad73278e1d0e3f04cdb9040f5058","observation_id":"da37e0fa-1e0f-437f-9935-12465a4d6df0","resolution":{"observed_at":"2026-08-11T12:16:32.530302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.518078Z","title":"Clustering with bregman divergences","venue":null,"work_id":"36cc4787-286f-48d3-a539-e4ee88b3fe2b","year":2005},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.016829Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:9c7754a8e5af536443fed4ecb8f64fcf32d23d9c8a206d7ff09b0238dafed024","observation_id":"05b24dda-9261-44f0-9a92-abeb00905921","resolution":{"observed_at":"2026-08-11T12:16:32.520990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-13T19:59:28.723365Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-11T12:16:32.019439Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.019439Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:59f95d8ea02720dcfe16c2c6aa59ec225f5ab6ca976c22026ed3ae09f5184b20","observation_id":"41168029-a0b7-4045-82c1-31903ff9efa5","resolution":{"observed_at":"2026-08-11T12:16:32.019439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-08-14T15:51:49.712613Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-11T12:16:32.022520Z","title":"chosen” response and one of the remaining three at random as the “rejected","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.022520Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:13ca3d057ea489af69a57e3b3de0bf30666db3dc390be0ab70d5a83e3e831fa5","observation_id":"484e4191-a869-4b78-bbf9-af172e8cac7c","resolution":{"observed_at":"2026-08-11T12:16:32.022520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.507909Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"6b4b0652-bfb4-41dd-83cb-b1a252acbe90","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.027443Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2b1fc4e136b8cfe6418c66b2a4403d1e4e0812820e6b36e2d2515eff7f6fb5ba","observation_id":"8210680e-89c7-418e-bff8-ce1a1fcc093d","resolution":{"observed_at":"2026-08-11T12:16:32.511971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.498874Z","title":"Limitations","venue":null,"work_id":"341fa0bc-17f4-4c33-b79f-9b8da5a86a41","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.030919Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:088206afdbbb7132fbec5ec0304b04aebd6dbb376811f62d071348cfddba45c8","observation_id":"26608078-d248-42dd-abf9-23a4eb8d7b11","resolution":{"observed_at":"2026-08-11T12:16:32.501635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.484629Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"47a7341d-67ef-48c4-945d-40657dc6ad4f","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.034227Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:95d1393a022ac4f2c4b2af2f55ca0166af2ccbc59fa9d8867024e1af70029041","observation_id":"4884cd23-33a9-4595-8b34-3bae026efaf8","resolution":{"observed_at":"2026-08-11T12:16:32.489123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.473633Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"be087016-18f8-45a6-bad1-2e8d4ca58ce8","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.038330Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:7d6d263ddbcb95c12fa1cbfdaedddba9cf41ab40a540482f467c9758cd6624e1","observation_id":"4826bd82-96f4-4751-875e-7cee43bda8b5","resolution":{"observed_at":"2026-08-11T12:16:32.476708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.463478Z","title":"• Please see the NeurIPS code and data submission guidelines ( https://nips.cc/ public/guides/CodeSubmissionPolicy) for more details","venue":null,"work_id":"c2a7e083-567e-4043-bd6f-64b81a8959c2","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.041960Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2e414833f4cf08c200eea14f3197504978d369650e4d8a1ca97dd8de339625e1","observation_id":"c0db1cac-3a60-4de3-8d6a-1daad2ad7748","resolution":{"observed_at":"2026-08-11T12:16:32.467290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.452199Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"8942faa0-5694-49c1-916c-546824610b8a","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.044849Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:79b6a96b37eceb6db8a487442cdb5b64294616c71d807356fa0f8de98f4f570d","observation_id":"aec86a50-2589-4464-aa65-e396144e2d65","resolution":{"observed_at":"2026-08-11T12:16:32.455381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.443244Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"ef831b96-e199-444f-82a8-81eba8eaba81","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.047698Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e19a75b06e973fb530c1ee26e5d8aabb2e34a2fc12bb06f2f81238524d578246","observation_id":"06642fd1-12b3-4dcd-bb92-f67df389f24a","resolution":{"observed_at":"2026-08-11T12:16:32.446467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.433038Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"1f659bef-863e-4c9b-b004-7f398f71689e","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.050305Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:2cf18fee4b5c7cef6ab6505b315c7cb912c11e3efa7408719c3bf3576714c46b","observation_id":"28738ff5-4694-48a8-8d58-87fd63ab9128","resolution":{"observed_at":"2026-08-11T12:16:32.437364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.421717Z","title":"Guidelines: • The answer NA means that the authors have not reviewed the NeurIPS Code of Ethics","venue":null,"work_id":"9e592541-d379-4e63-93f8-2e80ed9352a3","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.052865Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:df654f59683f104b231e91631bc9e7ea72c306441a266412b72c60dcb4f3fe1c","observation_id":"30282f20-6d4c-4f28-aed4-c4af1e1fea3c","resolution":{"observed_at":"2026-08-11T12:16:32.426109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.409558Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"98c6324b-d07d-4c04-8ed1-5a70176015fc","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.055941Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:1a06e4f00e6adade9a05d8fb00e29537069c48dbc800b58b036c3a9a101f1117","observation_id":"f9cea911-8a11-41e2-917e-369700efd3ee","resolution":{"observed_at":"2026-08-11T12:16:32.414192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.058383Z","title":"Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.058383Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:e289485634943312dd681442887c003b24040007e340287070cd862b5dde6f66","observation_id":"9bb2e117-02d4-49b7-b2ec-819966320e54","resolution":{"observed_at":"2026-08-11T12:16:32.058383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.394511Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"95bd1fea-3e12-49d2-bc5d-1f26765e0d5c","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.060850Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:eff65c8690cd01d737fcc23a7c268a3dee90e3453fcaebae0520324d590c4867","observation_id":"ea19d25d-37db-4e40-9eea-312ff696fdf3","resolution":{"observed_at":"2026-08-11T12:16:32.397363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.064064Z","title":"Guidelines: • The answer NA means that the paper does not release new assets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.064064Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:aac5a086211cfc4b33cbf545853aa2a6f809f6750dfcec57b1d9c91036609021","observation_id":"76ebee73-8f0e-4919-9cc8-415d8e5c5bb6","resolution":{"observed_at":"2026-08-11T12:16:32.064064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.067064Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.067064Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:f7e744b43c49f1c627cc9646bd7672e55961cba0b12d69dfb07c7f5bc6234682","observation_id":"5df0804e-650e-45aa-91b6-34563bce2854","resolution":{"observed_at":"2026-08-11T12:16:32.067064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:16:32.372275Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"a557be73-672d-45a8-accd-80f9f0094326","year":null},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:32.070018Z"},"links":{"citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:59b3894ddba082abd3ec0d95ac33751d0d7a6d0bbb2a9a87babf27d8799b9678","observation_id":"ea1687f3-4a6e-4d5d-aeef-083d0bd918a7","resolution":{"observed_at":"2026-08-11T12:16:32.375743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T00:53:12.423214Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 3 inbound Pith citation observations for arXiv:2412.14516."}