{"as_of":"2026-08-12T17:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:37714a8dc00bed557fc9ab01faf0c9aa3f1ea3f36e645b001fbb4f4ced1707ff","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:24:21.201297Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:40:08.618174Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17696","snapshot_observed_at":"2026-08-04T17:40:08.618174Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10818","last_updated":"2025-09-13T14:35:51Z","snapshot_observed_at":"2026-08-11T20:50:19.426787Z","submitted_at":"2025-09-13T14:35:51Z","title":"LLM Enhancement with Domain Expert Mental Model to Reduce LLM Hallucination with Causal Prompt Engineering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:40:08.618174Z"},"links":{"cited_paper":"/paper/2412.17696","citing_paper":"/paper/2509.10818"},"observation_digest":"sha256:adabc8f70705e4a0acfd498dce1dbce358050a219aa343e9ac5e8155e4f0b412","observation_id":"1256f83f-8b8c-48b4-952c-e40239160c53","resolution":{"observed_at":"2026-08-04T17:40:08.618174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17696/citation-record","integrity":"/paper/2412.17696/integrity","json":"/paper/2412.17696/citation-record.json","paper":"/paper/2412.17696"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:21.999876Z","title":"DPO and reference approaches For DPO we see a simi- lar derivation","venue":null,"work_id":"882caf6e-c4d3-407c-8d2e-8622f44f4c4d","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.201297Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:e9bf87780f73671ebb678dca2d2f4dee56055f584c916c2cfb0b8c1e9a1365d4","observation_id":"d0a1f17e-f51c-40d3-8ab6-001ac9e1eba5","resolution":{"observed_at":"2026-08-11T05:24:22.006297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-10T23:26:33.935470Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-11T05:24:20.962220Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.962220Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:52cac028d682d85983b6c8342189d776373e986a14c7283f08d40673728081f0","observation_id":"0111fb54-4587-4207-b997-8cb7afef2f24","resolution":{"observed_at":"2026-08-11T05:24:20.962220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.577177Z","title":"Prompting is programming: A query language for large language models","venue":null,"work_id":"21bbb083-4894-4cb1-936c-92f32b76e977","year":1946},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.906537Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:93dc70d5eccb5686844f0abd1797a64592bd95615a24b5d45f417350ec33c41b","observation_id":"bf35de68-9326-4805-99dc-8c8d70e18ea5","resolution":{"observed_at":"2026-08-11T05:24:22.584053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.263873Z","title":"However, the semantics of the resulting formulas are less transparent and often hidden in the weights","venue":null,"work_id":"65822f00-40fa-4c4a-8022-28cd5f0a0177","year":2008},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.117785Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:61ef18462236dcc8aaf2ec4f755b8ad29b57d38d0f4539b6df3f362a0dc60ddb","observation_id":"6ad0fa82-4bd7-4133-908a-cde191a52c5e","resolution":{"observed_at":"2026-08-11T05:24:22.269988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.245834Z","title":null,"venue":null,"work_id":"8af30117-3ab8-4f4b-a9f2-a80e76df5640","year":2018},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.132004Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:e110152609a5d343ff03c888f836d074bfb15438f25bf2ba3f5b2ec1cfc7c85b","observation_id":"2d8a9011-4bef-4877-8b94-0c90a79650be","resolution":{"observed_at":"2026-08-11T05:24:22.251827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.287999Z","title":"(2024)), all of which were originally implemented using the logistic log-loss, i.e., each ℓx = − log σ(βρθ)","venue":null,"work_id":"15b02992-ca18-497e-a064-c68fdf32be28","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.109725Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:101b9dd13a813c62363e450c4d3720302b7cd6be0420976ad3128018de733211","observation_id":"5e46e22c-3252-447b-9901-8dcdbbbb3437","resolution":{"observed_at":"2026-08-11T05:24:22.299157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09521","last_updated":"2025-01-30T13:51:30Z","snapshot_observed_at":"2026-08-11T19:10:24.902552Z","submitted_at":"2024-05-15T17:24:34Z","title":"Declarative Design of Neural Predicates in Neuro-Symbolic Systems","version":3},"cited_work":{"arxiv_id":"2405.09521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09521","snapshot_observed_at":"2026-08-11T05:24:21.806909Z","title":"Declarative Design of Neural Predicates in Neuro-Symbolic Systems","venue":"cs.AI","work_id":"11840bdc-7b44-4f96-bcbd-8a95cfc91b36","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.948288Z"},"links":{"cited_paper":"/paper/2405.09521","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:219a55fe6dfc09955b7179e8fc74d1bd1c65e9e50c361292a515389c8fdc0288","observation_id":"c66a9439-ef3d-441a-b65a-e1e8c1fb8e9e","resolution":{"observed_at":"2026-08-11T05:24:21.814063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09072","last_updated":"2024-07-12T07:52:32Z","snapshot_observed_at":"2026-08-11T19:11:04.236934Z","submitted_at":"2024-07-12T07:52:32Z","title":"New Desiderata for Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09072","snapshot_observed_at":"2026-08-11T05:24:20.955189Z","title":"New desiderata for direct pref- erence optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.955189Z"},"links":{"cited_paper":"/paper/2407.09072","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:8c8f6f23bf5812709cd7a95ec9340bc3bda121d75c3f0763e325ddc3b64ce825","observation_id":"0c66f357-b5a3-40e5-9fa6-e302bcf1e5d7","resolution":{"observed_at":"2026-08-11T05:24:20.955189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.087197Z","title":null,"venue":null,"work_id":"627925b5-27ef-4f02-aabc-b829f6599509","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.181808Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:819b7fd0024d994e16dca46155cafd9b3dcd30ea4054cce2c1bed0188858d3c5","observation_id":"abb00165-1fc0-45e3-902b-a15b12efbb6e","resolution":{"observed_at":"2026-08-11T05:24:22.094340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-11T05:24:20.967825Z","title":"T., Moazam, H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.967825Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:1f19f540f474c24a55f60d0f3cc6fb99d9f464a2e65935e1dd66ae2ef85d3791","observation_id":"bce74ebd-ad1f-496b-b3b1-031884d5bdb2","resolution":{"observed_at":"2026-08-11T05:24:20.967825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15685","last_updated":"2024-04-16T02:46:58Z","snapshot_observed_at":"2026-07-06T17:07:52.197869Z","submitted_at":"2023-12-25T10:29:28Z","title":"What Makes Good Data for Alignment? A Comprehensive Study of Automatic Data Selection in Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15685","snapshot_observed_at":"2026-08-11T05:24:20.973467Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.973467Z"},"links":{"cited_paper":"/paper/2312.15685","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:bf4c6cbb90e901e2b7a171491d2a39cf8707da3802aa5b36bc499db63a9adae8","observation_id":"eafd6341-2023-40b8-b3e6-2f8de101f702","resolution":{"observed_at":"2026-08-11T05:24:20.973467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-08T16:03:10.053914Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-11T05:24:20.993315Z","title":"Smaug: Fixing failure modes of pref- erence optimisation with dpo-positive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.993315Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:547e9e37a1b7dcd2f17bcf87ca54dbbd5d4c4635bd28188da0f0c409576cd207","observation_id":"abec1c88-e4f0-44a8-b698-8f6fa80a6cc9","resolution":{"observed_at":"2026-08-11T05:24:20.993315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-08-12T12:27:39.928843Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-11T05:24:20.999144Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.999144Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:5a0fca6a6ac41234c3fbc267a0d7628cc7eef08a26ee8cb1e82c080625d8c49e","observation_id":"06962f4c-82bd-4b5b-bec6-339adcad19d5","resolution":{"observed_at":"2026-08-11T05:24:20.999144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08847","last_updated":"2025-04-27T15:21:29Z","snapshot_observed_at":"2026-08-11T19:12:27.255980Z","submitted_at":"2024-10-11T14:22:44Z","title":"Unintentional Unalignment: Likelihood Displacement in Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08847","snapshot_observed_at":"2026-08-11T05:24:21.004610Z","title":"Unintentional unalignment: Likelihood displacement in direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.004610Z"},"links":{"cited_paper":"/paper/2410.08847","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:60ae800d7807d7d431f552f6521fc221a0100941c7b951e2dae94472887e5b7d","observation_id":"1a751ee2-beb9-44da-abe4-69ee1e1a6251","resolution":{"observed_at":"2026-08-11T05:24:21.004610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10650","last_updated":"2023-10-05T11:17:08Z","snapshot_observed_at":"2026-07-06T15:05:24.018286Z","submitted_at":"2023-03-19T13:03:51Z","title":"Logic of Differentiable Logics: Towards a Uniform Semantics of DL","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10650","snapshot_observed_at":"2026-08-11T05:24:21.018605Z","title":"L., Stew- art, R., and Stark, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.018605Z"},"links":{"cited_paper":"/paper/2303.10650","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:000ad43186357641be531807e9c24ae93f00fac1cc5ba218111b7c034644ac4d","observation_id":"4f5e94b0-964b-422b-95cc-a1d42b3718ab","resolution":{"observed_at":"2026-08-11T05:24:21.018605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08458","last_updated":"2024-06-07T15:10:50Z","snapshot_observed_at":"2026-08-11T19:11:39.298790Z","submitted_at":"2024-04-12T13:09:48Z","title":"On the Independence Assumption in Neurosymbolic Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08458","snapshot_observed_at":"2026-08-11T05:24:21.031248Z","title":"Uller: A unified language for learn- ing and reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.031248Z"},"links":{"cited_paper":"/paper/2404.08458","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:e847ad8483d382327c5cc94ffd5d66f948095fa7122b95068b33f08de505e111","observation_id":"10e3b6cb-bd84-427e-8659-3fdf57c1791d","resolution":{"observed_at":"2026-08-11T05:24:21.031248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-11T19:09:11.098841Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-11T05:24:21.038122Z","title":"Aligning large language models with human: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.038122Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:a49c6bc505da38c1080cb6c0f8fd3510c901df608023431d291311fa972dcd5b","observation_id":"284ccd89-8ef2-440e-bfc6-ee470834b2dd","resolution":{"observed_at":"2026-08-11T05:24:21.038122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-10T21:54:38.067043Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-11T05:24:21.054154Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.054154Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:9508a5f629522133ff646a7ceae94bd18bc7281cf02c8c8d8e68d3e17af4c518","observation_id":"4901e4e7-b1e8-459a-bf61-8b71d7051ea0","resolution":{"observed_at":"2026-08-11T05:24:21.054154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19774","last_updated":"2025-04-07T06:11:54Z","snapshot_observed_at":"2026-08-11T19:11:42.083130Z","submitted_at":"2024-06-28T09:23:40Z","title":"Direct Preference Knowledge Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19774","snapshot_observed_at":"2026-08-11T05:24:21.060498Z","title":"Direct preference knowledge distillation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.060498Z"},"links":{"cited_paper":"/paper/2406.19774","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:11536cf591572544198a7ea33ec3650f248e98fd645fab1773b48dca7d2dbeb0","observation_id":"40eda98e-d5ba-4dc1-a581-bec958921811","resolution":{"observed_at":"2026-08-11T05:24:21.060498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-11T15:39:32.425305Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-11T05:24:21.066176Z","title":"Rrhf: Rank responses to align language mod- els with human feedback without tears","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.066176Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:353abe4a87ad1387ae16464453fffc18ea7f02faeb5cc8927e0c676b2c13e684","observation_id":"850d7631-4d98-485c-b575-5144a537d229","resolution":{"observed_at":"2026-08-11T05:24:21.066176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-10T10:05:24.083432Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-11T05:24:21.081152Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.081152Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:b572785fe1e481fda8541c9008c66e17fd6868c8f56293924768a4491a9ac9ee","observation_id":"288e9c2b-27e3-4ba6-a0e5-93f5ba2565a2","resolution":{"observed_at":"2026-08-11T05:24:21.081152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-11T05:24:21.087673Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.087673Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:60d62d0fe50e0e1d2f183bda3be12ea55bd866fa091400bfa517f49c8a486a4d","observation_id":"07cb74ed-9771-4d1b-9b57-abe0b32ff339","resolution":{"observed_at":"2026-08-11T05:24:21.087673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.552331Z","title":"Original losses Further details of the original losses in Table 2, along with other variants such as R-DPO (Park et al., 2024), ODPO (Amini et al.,","venue":null,"work_id":"6417e586-478b-4a12-8318-b53d57a84822","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.094593Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:27df63ddc171c3f0f0de8724d2f72575edf364ffecc9b21da5a727492b8ca854","observation_id":"08ac64bf-a997-4ce5-8d86-31eba4898ee9","resolution":{"observed_at":"2026-08-11T05:24:22.561090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.314734Z","title":null,"venue":null,"work_id":"bcf38c89-0091-446c-bcc9-e438c95ef9ac","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.102120Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:6e4ce5e3100593e5be7499599dd7036d25e642b6a01564c90154c790e24f0577","observation_id":"79cc82fc-f00b-456e-ae12-ce0e46fa8dbc","resolution":{"observed_at":"2026-08-11T05:24:22.322172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.225070Z","title":null,"venue":null,"work_id":"c4625573-02bc-4566-9e59-f8d145a904c6","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.144992Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:114a3ad6bf2a3eb8b897d46d75e0810034bda7a61ad8fd54f7a59f79aeaa8676","observation_id":"760683a3-978d-4327-ae60-b26e18cb20ff","resolution":{"observed_at":"2026-08-11T05:24:22.231084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.196337Z","title":"Figure 8 shows the Boolean semantics of DPO/SimPO and some novel variants based on the ref- erence form of ORPO (ℓORPO-ref), qfUNL (ℓqfUNL-ref) and l5 (ℓl5-ref)","venue":null,"work_id":"ce902f4d-a6ab-45c1-8baa-8adfd4ed83b5","year":2017},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.153250Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:92c0ed2d8c5443743cc7c80b02f89ce59823de8d1a49666ee3964406ca990f2b","observation_id":"dddd4f5a-9429-49cc-bc0b-28ae4e408065","resolution":{"observed_at":"2026-08-11T05:24:22.203410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.165465Z","title":"Specifically, we focus on losses around the known lossℓCPO, which we treat as a natural baseline to compare against","venue":null,"work_id":"03c838a6-eff3-4a7c-a574-363bbb6b1a02","year":2017},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.161667Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:6dc32736d02acc5dbb28858a6d73a2243698982dcd63f970a2206b1e0ee7fcb1","observation_id":"df7b99b7-a451-476c-a0ac-ecfe48709ca6","resolution":{"observed_at":"2026-08-11T05:24:22.180401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.141766Z","title":"While these experiments are small scale and limited in scope, they are merely meant to suggest possible uses our frame- work and open questions","venue":null,"work_id":"4e55d9f6-fa06-436b-85bc-fbba09a06c5b","year":2023},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.168358Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:a29b13c16629d121a8ea2594e5e117e13d84767bcb9042335806b8fae2fe96e5","observation_id":"2df5a295-1b62-4a41-8878-ca9d34ff8621","resolution":{"observed_at":"2026-08-11T05:24:22.148719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.107526Z","title":"To avoid repeating the process of instruction tuning, we started from the trained Qwen model released in the TRL library6","venue":null,"work_id":"a3776d23-5de8-49f5-a799-5423ef7da865","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.175960Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:9da2f1076f9bb9119ea545049547bbeb2c27e88c45a2e8bc9f23679e550fff74","observation_id":"277d8756-1265-4cb3-90e4-4bf1a4c3bef1","resolution":{"observed_at":"2026-08-11T05:24:22.115175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.054011Z","title":"This suggests that different types of preference data rely on a different semantics of preference, which requires a tuning approach that’s tailored to those differences","venue":null,"work_id":"191c8b00-37b5-4772-a123-e1e53922a89d","year":2024},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.187556Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:294a6ce0cbdbe2e3905036e92d8dce07eee7ba45db3b2171940667f82dd1941c","observation_id":"5e9f422a-dc72-4b1f-a4c9-e8100f6224a7","resolution":{"observed_at":"2026-08-11T05:24:22.060177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:22.025447Z","title":null,"venue":null,"work_id":"174215ee-cca1-4e56-ae3d-d9cbf75b1080","year":2021},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.194620Z"},"links":{"citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:a253f51bb9ecd70ba8c706c24e9919a1ef65ac658c333ff742c40066de850c80","observation_id":"2ea43b70-4807-4d59-b405-1be9ba8fffb7","resolution":{"observed_at":"2026-08-11T05:24:22.035349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19332","last_updated":"2024-11-05T07:21:18Z","snapshot_observed_at":"2026-08-11T19:12:39.807050Z","submitted_at":"2024-05-29T17:59:07Z","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19332","snapshot_observed_at":"2026-08-11T05:24:21.075426Z","title":"Self-exploring language models: Active preference elicitation for online alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":1975,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.075426Z"},"links":{"cited_paper":"/paper/2405.19332","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:bc11d5052eef8bd72be1eff6de7913b52c04e83b423eca05ad6e5876134d7025","observation_id":"7173bdc4-e1e1-48a7-85ae-4dbfe67fac49","resolution":{"observed_at":"2026-08-11T05:24:21.075426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-08-11T19:11:24.361261Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-11T05:24:21.023974Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":1977,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.023974Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:6105d8afec274f98e574af561e0dbfcfac6939e42161772fdab654a20458e26d","observation_id":"042ff44e-30a7-4c63-b41f-c437002ba784","resolution":{"observed_at":"2026-08-11T05:24:21.023974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10342","last_updated":"2022-07-28T16:51:14Z","snapshot_observed_at":"2026-08-11T19:12:03.167721Z","submitted_at":"2022-07-21T07:35:18Z","title":"Language Model Cascades","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10342","snapshot_observed_at":"2026-08-11T05:24:20.922116Z","title":"G., Wu, Y ., Michalewski, H., Saurous, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.922116Z"},"links":{"cited_paper":"/paper/2207.10342","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:3e1bac193e05f5e959bcb0db484d66b704336e3e7269d2e5ed31797daacf4711","observation_id":"a7aefa3f-ddfd-4ddf-9c9e-581dfea35e95","resolution":{"observed_at":"2026-08-11T05:24:20.922116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14723","last_updated":"2025-02-08T16:29:14Z","snapshot_observed_at":"2026-08-11T19:11:39.176941Z","submitted_at":"2024-04-23T03:55:01Z","title":"Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14723","snapshot_observed_at":"2026-08-11T05:24:21.012067Z","title":"Insights into align- ment: Evaluating dpo and its variants across multiple tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.012067Z"},"links":{"cited_paper":"/paper/2404.14723","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:fa41802360520f9f89a686cdc60e1bb74fab21276b5f364d26a4fda4ca893fb4","observation_id":"9b9b2a69-ef90-4f56-89ff-cc6b22f408c4","resolution":{"observed_at":"2026-08-11T05:24:21.012067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08609","last_updated":"2018-08-26T18:36:20Z","snapshot_observed_at":"2026-08-11T19:11:34.244697Z","submitted_at":"2018-08-26T18:36:20Z","title":"Adversarially Regularising Neural NLI Models to Integrate Logical Background Knowledge","version":1},"cited_work":{"arxiv_id":"1808.08609","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.08609","snapshot_observed_at":"2026-08-11T05:24:21.662964Z","title":"Adversarially Regularising Neural NLI Models to Integrate Logical Background Knowledge","venue":"cs.LG","work_id":"5b7296c6-f290-4034-8f57-ba23a3e7c0f6","year":2018},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.980347Z"},"links":{"cited_paper":"/paper/1808.08609","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:e398f0801219af29b78092aebf2d630cbf86afedc755c135312753064521207a","observation_id":"5008a5d1-b1f4-4458-9452-ba3077d2eac9","resolution":{"observed_at":"2026-08-11T05:24:21.671331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19133","last_updated":"2025-05-30T23:40:44Z","snapshot_observed_at":"2026-08-06T16:11:49.973896Z","submitted_at":"2024-10-24T20:04:15Z","title":"Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19133","snapshot_observed_at":"2026-08-11T05:24:20.987102Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.987102Z"},"links":{"cited_paper":"/paper/2410.19133","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:88f29712530de48e8ff2c763e71d0ef96dd972bc2dbf234c33a1f3a2d2ef9be8","observation_id":"a47bfd00-65e2-47a2-840c-31ccc875dd04","resolution":{"observed_at":"2026-08-11T05:24:20.987102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11564","last_updated":"2024-11-03T01:51:57Z","snapshot_observed_at":"2026-08-11T19:12:34.295528Z","submitted_at":"2024-09-17T21:28:51Z","title":"Preference Tuning with Human Feedback on Language, Speech, and Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11564","snapshot_observed_at":"2026-08-11T05:24:21.046827Z","title":"I., Zhao, H., Das, A., Tang, W., Yao, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:21.046827Z"},"links":{"cited_paper":"/paper/2409.11564","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:13a4fbf89d1ea981f2d74837f1fb5b139d4780e57d94dabaa8f6f00e38c8165f","observation_id":"1ac67d50-851b-4d1c-bfda-2c50bd113595","resolution":{"observed_at":"2026-08-11T05:24:21.046827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-11T01:15:48.115059Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-11T05:24:20.892964Z","title":"G., Rowland, M., Piot, B., Guo, D., Calandriello, D., Valko, M., and Munos, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.892964Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:2bcfd202c159f10d89e78ef9e075c4608b6b21f5d9de19a350864f8752c91d95","observation_id":"a6df2947-5ffe-4330-ab02-943c86d44356","resolution":{"observed_at":"2026-08-11T05:24:20.892964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-10T08:55:18.452315Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-11T05:24:20.937725Z","title":"Direct language model alignment from online ai feedback.arXiv preprint arXiv:2402.04792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.937725Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:aa9de5bce61fa19b708cdd514ec7ea1a3ffb7ac2df667cc2a3739f8c8f03d07c","observation_id":"196dde86-df55-4ed1-a5cf-279d0f442537","resolution":{"observed_at":"2026-08-11T05:24:20.937725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08968","last_updated":"2017-05-24T21:34:14Z","snapshot_observed_at":"2026-07-06T05:44:09.511384Z","submitted_at":"2017-05-24T21:34:14Z","title":"Logic Tensor Networks for Semantic Image Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08968","snapshot_observed_at":"2026-08-11T05:24:20.929299Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.929299Z"},"links":{"cited_paper":"/paper/1705.08968","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:5cb3cf4168805c476f7789decae3b7dac5bbe330d816ead795bd377577443cdc","observation_id":"f4ac2847-9f4d-432d-84e5-379e57c986ee","resolution":{"observed_at":"2026-08-11T05:24:20.929299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T05:24:20.900125Z","title":"Qwen technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.900125Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:745a325e0136beaf51ab08c163e80a9131acb6a56513c694118f5e165804f4d9","observation_id":"f56f1ffc-df57-47c5-93e2-aabd9cd11047","resolution":{"observed_at":"2026-08-11T05:24:20.900125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13724","last_updated":"2024-09-09T10:52:57Z","snapshot_observed_at":"2026-08-11T19:11:26.937807Z","submitted_at":"2024-09-09T10:52:57Z","title":"Logically Consistent Language Models via Neuro-Symbolic Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13724","snapshot_observed_at":"2026-08-11T05:24:20.914415Z","title":"Logically consistent language models via neuro-symbolic integration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T05:24:20.914415Z"},"links":{"cited_paper":"/paper/2409.13724","citing_paper":"/paper/2412.17696"},"observation_digest":"sha256:1feb37b10c69d573cfe9c5de7e6e751af9c86518ff8ce562a73c6c3aa3e24bfa","observation_id":"5efe21c0-8cd9-42a8-9303-558f084c5ea0","resolution":{"observed_at":"2026-08-11T05:24:20.914415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17696","last_updated":"2025-03-27T17:30:56Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T19:09:58.862507Z","submitted_at":"2024-12-23T16:23:13Z","title":"Understanding the Logic of Direct Preference Alignment through Logic"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2412.17696."}