{"as_of":"2026-08-09T04:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25def229605a86edb7a0f8278178bde27474eedbf0c792412465634cf35bc9a7","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:52:38.826438Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07855/citation-record","integrity":"/paper/2507.07855/integrity","json":"/paper/2507.07855/citation-record.json","paper":"/paper/2507.07855"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.124912Z","title":null,"venue":null,"work_id":"f895c75e-2ce7-444c-9219-ace1f748dd66","year":2012},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.515815Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:ce381499eb1b1efb363988ac62a258db99182b3b9d354e8f38819ee224cdc932","observation_id":"965346be-dd5c-4541-a403-540a244512fa","resolution":{"observed_at":"2026-08-06T18:52:40.129033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.06568","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.367526Z","title":"Alfano, S","venue":null,"work_id":"5a7c8cda-d730-4d07-b286-4f17edfbc1e8","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.577577Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:3a18eefe77ee403b3c630d29e231b9090ef8f35ee539d3471d0559e706d03538","observation_id":"81fccb27-e677-4950-bdec-22a72fff3fde","resolution":{"observed_at":"2026-08-06T18:52:39.375745Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.112453Z","title":"Amari and H","venue":null,"work_id":"e6ce5259-b0be-4683-8730-bbb0f5bb2f18","year":2000},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.693550Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:8dfe7a75539f8de4a650310850cbf3e1e0da1f2e2a464c6b0110a31e336cb915","observation_id":"80ac216e-2012-4d87-b9ef-03a0217c83c2","resolution":{"observed_at":"2026-08-06T18:52:40.116234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.099590Z","title":null,"venue":null,"work_id":"bb55d944-fb33-46d2-b4d4-232bdd39b162","year":1971},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.787534Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:3cf080bbbe4921f57c273ee884eb1d33bf7dae95c60a40ccecb58324218e64a2","observation_id":"9a063b77-0699-426f-9c4c-ff02860b399c","resolution":{"observed_at":"2026-08-06T18:52:40.103357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.087374Z","title":null,"venue":null,"work_id":"f82a7974-59d9-4895-b462-9d127ec0be2e","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.863589Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:9e3820e24d9387b9a12e29fe4d514ee7d5061c47e8e7df1e2f31f8952a78e431","observation_id":"d8a5099f-8521-45ab-8fd5-6f6d36949e01","resolution":{"observed_at":"2026-08-06T18:52:40.091265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.074694Z","title":"Bao and N","venue":null,"work_id":"7a934cb2-912b-4dc7-96d3-44bce6bca6d5","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:33.934402Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:bbe96b3104fd96e73f2cc80357271dd8b22abea279652a5a9f1601947da3a0a0","observation_id":"5acc9787-cfeb-4a03-a9ef-73a41d7caafc","resolution":{"observed_at":"2026-08-06T18:52:40.078926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.061833Z","title":null,"venue":null,"work_id":"983460db-401e-4194-bcd3-c24bc94b0473","year":1979},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.039406Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:4578e46f960b796daffe899ce9ed122144c215e46fbfe346383c71760c0155cd","observation_id":"75ca5948-f075-4972-aad3-1adc2626e9d7","resolution":{"observed_at":"2026-08-06T18:52:40.065896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.049643Z","title":"Blondel, A","venue":null,"work_id":"cfe483ac-12b2-4b8d-8433-c57f8c3e9c22","year":2020},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.197979Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:72a9b4bd38e3747bff306a72339594d38f787a13da588b8cf497988e245ebd93","observation_id":"02724bf2-6657-422a-991a-34a97ae0e295","resolution":{"observed_at":"2026-08-06T18:52:40.053423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.036591Z","title":null,"venue":null,"work_id":"85428063-4ddf-42fa-968d-18f10616ba40","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.263682Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:b9ca1e6cfc17e4205492c1ef43fe22a1cbb5b420abc2dfb38b480c6da780d5d3","observation_id":"9f798169-da66-4976-988e-1f5427eabfa9","resolution":{"observed_at":"2026-08-06T18:52:40.040610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.023683Z","title":null,"venue":null,"work_id":"397355d6-baad-461c-ad10-cecec7b12cf7","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.366115Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:88ae3102580447144a1e2fa22cba2fd8b1c783b97a28fc3b71ac5e083504a357","observation_id":"02b8a3f9-e2c3-4d3b-9b5f-1ec9f1231fd8","resolution":{"observed_at":"2026-08-06T18:52:40.027737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:40.009763Z","title":null,"venue":null,"work_id":"6af04504-9a69-45ed-b64e-1a83aed0e99b","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.469748Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:b84e2046515f8f1cb786a1cb8dc7253e4440c7c6a0f90c36ed38412566c38f37","observation_id":"98eb9345-e399-4045-bbdb-d7f2cdf0b977","resolution":{"observed_at":"2026-08-06T18:52:40.014204Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.995194Z","title":null,"venue":null,"work_id":"ba9e20ca-692d-4d8d-b6fc-b68e9eee17ff","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.542796Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:1c3f95e73cef2d23f3235f516ad1749011e742ae4b150695d9ce8b518dd95579","observation_id":"ec68244f-d308-4ea8-8d49-23025093a4f6","resolution":{"observed_at":"2026-08-06T18:52:39.999814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.981127Z","title":null,"venue":null,"work_id":"e7942087-6e70-4384-a829-5b6c6753cf0d","year":2007},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.639454Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:fbc52013a7c1d12013f12158037377009b1cb369bbdf08deccd974706feac9a4","observation_id":"c8a8fa34-7bb3-4ca3-9565-c24ec8214238","resolution":{"observed_at":"2026-08-06T18:52:39.985297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.967293Z","title":null,"venue":null,"work_id":"a62a8fb1-3792-41f4-b4cd-637cc33b5e09","year":1958},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.793576Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:6ba1278a4f8087ad5005f892438e7c2f6b423202e1501f15054b59ae4f763f84","observation_id":"d5c96902-2571-47f1-997d-aba9d37f84e3","resolution":{"observed_at":"2026-08-06T18:52:39.971992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.954036Z","title":"Doignon and J.-C","venue":null,"work_id":"e6f355cb-a9e4-404c-9660-7c28cd319577","year":1974},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.870271Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:4ef620f14bad82eae8e9b25973a3e2eb74b14218cb37b782beee6826f3c8e715","observation_id":"3aba22c1-3715-4e1a-8acc-44cf78ad5ff3","resolution":{"observed_at":"2026-08-06T18:52:39.958070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.941058Z","title":"Ethayarajh, W","venue":null,"work_id":"445af407-8f57-4cf7-baec-040bc0647fa8","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:34.946745Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:92f9392d5b0af87c24a3ad68aefc49e25d6c3425345d80dce63c33a5b822b6fd","observation_id":"e6e2ce3d-05c8-46d8-99fd-a7221203e38f","resolution":{"observed_at":"2026-08-06T18:52:39.945039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.927920Z","title":"Gneiting and A","venue":null,"work_id":"59d7056f-03b2-4686-8534-ed908a82e260","year":2007},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.057746Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:6ab0fa1579e4bcb34f7cec1851688fbc734019d31d298903dfccef56ea8ee087","observation_id":"b4cd4805-d636-4f9b-999f-2bf556a9bfbe","resolution":{"observed_at":"2026-08-06T18:52:39.931857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T18:52:35.156728Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.156728Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:e049f385516f6b5b239c05c96f565ede343a1c89bf023cff8c68fb3c962bb885","observation_id":"32cf51ff-128e-4429-903c-9e18fb93f4dc","resolution":{"observed_at":"2026-08-06T18:52:35.156728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:35.231062Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.231062Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:5bc6d316fb2465a820e2a667f41e1ba58a55cf3457de88be8e8a874540ce3f1e","observation_id":"0b4a9192-b9bf-4986-bc94-d7c986731020","resolution":{"observed_at":"2026-08-06T18:52:35.231062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03884","last_updated":"2025-05-30T04:56:02Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T15:46:42Z","title":"AlphaPO: Reward Shape Matters for LLM Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03884","snapshot_observed_at":"2026-08-06T18:52:35.347941Z","title":"Gupta, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.347941Z"},"links":{"cited_paper":"/paper/2501.03884","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:db416d5d8b1a866716bc8fc9a680fed95857bc21ceaa20630a1242935c738ae5","observation_id":"8a966e47-8557-4927-a89b-76ffe185a115","resolution":{"observed_at":"2026-08-06T18:52:35.347941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.905513Z","title":"Hastie, R","venue":null,"work_id":"f1ace3fe-a87d-4784-a2c7-62e097e4e502","year":2002},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.450714Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:9f884d79bb41e438bd59d43171eba3e1b4d9b971fdd198fa9ff6bdba6406e049","observation_id":"0b463851-738e-4987-a460-caae629ac756","resolution":{"observed_at":"2026-08-06T18:52:39.909162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.892658Z","title":null,"venue":null,"work_id":"8196ca65-df89-4ed2-a8d7-ac26200931fc","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.600101Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:1190760d000103222d09f8f3f8cd9ad427e8887530cccad254cfdd33665d16c0","observation_id":"5229e8a3-3a7e-4622-99b7-61e3fb4701fb","resolution":{"observed_at":"2026-08-06T18:52:39.896574Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.879699Z","title":"Huang, W","venue":null,"work_id":"e054ba7b-4dc4-4c2d-bb56-21274c9e5e28","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.670121Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:d7c7f57373ddda5b4909a2cb00e8eac56d7f918f2c2683ec91a72e435de3ca59","observation_id":"8a5b238e-5927-42cc-bb41-8ba86e955dda","resolution":{"observed_at":"2026-08-06T18:52:39.883467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10702","last_updated":"2023-11-20T02:01:33Z","snapshot_observed_at":"2026-08-09T03:30:59.643714Z","submitted_at":"2023-11-17T18:45:45Z","title":"Camels in a Changing Climate: Enhancing LM Adaptation with Tulu 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10702","snapshot_observed_at":"2026-08-06T18:52:35.793726Z","title":"Ivison, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.793726Z"},"links":{"cited_paper":"/paper/2311.10702","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:006e81a343d2e432934a8024651b8727e2cab4a18e7d22155611f718b8ecf486","observation_id":"f4ce977c-d379-4f66-ae69-9b6c4f9dd52b","resolution":{"observed_at":"2026-08-06T18:52:35.793726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.866132Z","title":"Kakade, A","venue":null,"work_id":"ecd0c3e8-594d-4feb-a830-2a1ca28ee710","year":2011},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.884856Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:3d8f989a74cd245610e8b31f03d7edc45c5c882477915fdd7e2d53e34c7ab0f7","observation_id":"54ec5f14-ff72-42b4-be43-e7ced6156b14","resolution":{"observed_at":"2026-08-06T18:52:39.870296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.852980Z","title":null,"venue":null,"work_id":"fd622a3f-d88d-47b8-ab1e-242fbf5f0fc6","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:35.950676Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:ff08cac14f91da7669bbb74889beac14a49bb81b08dbdbbea0cbe85e5688f182","observation_id":"207c34d9-a568-4712-a475-d5c6144f41cf","resolution":{"observed_at":"2026-08-06T18:52:39.857109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.839848Z","title":null,"venue":null,"work_id":"6a42cd66-b30e-4b13-b42b-5168ed33bb14","year":1989},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.013640Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:8884024670cc2a04c5fe0396763d7c1354f24a03206db9dd600426a8d7b73884","observation_id":"1a545f81-5c72-4731-a87e-71a3aea4a00b","resolution":{"observed_at":"2026-08-06T18:52:39.843801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.826190Z","title":null,"venue":null,"work_id":"ad1164a6-75d5-4522-bf43-58b2c0cf91ad","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.081485Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:221914812740c3c4484ace19e9004836395e979b23a58a66ddf168c728e36731","observation_id":"d2c9642c-e399-49e0-952e-8cf8db96b42a","resolution":{"observed_at":"2026-08-06T18:52:39.830449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19774","last_updated":"2025-04-07T06:11:54Z","snapshot_observed_at":"2026-07-06T18:38:21.977142Z","submitted_at":"2024-06-28T09:23:40Z","title":"Direct Preference Knowledge Distillation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19774","snapshot_observed_at":"2026-08-06T18:52:36.169261Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.169261Z"},"links":{"cited_paper":"/paper/2406.19774","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:21e482215b385997dd9fea4c7ce6227aea1ddd1143a6feee76c1cad0ec20e0f7","observation_id":"d31023e5-7897-444b-a6ca-3cbc8878500c","resolution":{"observed_at":"2026-08-06T18:52:36.169261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.813088Z","title":null,"venue":null,"work_id":"3a54cad7-fd8b-4f81-901b-704d14fd7a0d","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.262670Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:0386fba7784be5c8da50f0bdea5af2e97c1b39037adefe601ead75d11af1420d","observation_id":"90904036-3fb3-48b8-8851-53fe7c53e6a8","resolution":{"observed_at":"2026-08-06T18:52:39.817390Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.800559Z","title":null,"venue":null,"work_id":"4cd65ac1-157c-4496-a1ce-0d8990afed1e","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.334781Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:d1a7975ea56a2207a345d46f52f642531ee2fa006a1d671ee74140606e5dfb9e","observation_id":"8a726a5b-64ff-4d3e-b2b1-3d1b9561d547","resolution":{"observed_at":"2026-08-06T18:52:39.804388Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.787693Z","title":null,"venue":null,"work_id":"d2af9cf6-6691-47e6-ac77-1ebb096047ba","year":1985},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.408635Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:1d8476228fe6f7e6f9385886563e5c1a374eed3afa2df4ab1c7673c6eb1be1ca","observation_id":"84697ba7-17f3-401a-adc4-40948e8236d8","resolution":{"observed_at":"2026-08-06T18:52:39.791682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.774476Z","title":null,"venue":null,"work_id":"19aacd8b-8f4a-4b6e-a976-30c51d020eeb","year":2014},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.471253Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:6e3987b4a442dd68bc72c21ba28ab9925669577e54ae9aad41dbad1bb9bea8f9","observation_id":"8ba6d603-4793-466b-9b3d-f8b415ccc5aa","resolution":{"observed_at":"2026-08-06T18:52:39.778771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.761636Z","title":"McCarthy","venue":null,"work_id":"ec439419-ad07-4b7a-ad54-de2f63a3b49c","year":1956},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.561030Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:8ee1015810b04ffe70c6b265a3a58b6e995bfe6d026e070b389f0e68b366e7c9","observation_id":"076ddc84-144c-4949-81a0-2359698b150f","resolution":{"observed_at":"2026-08-06T18:52:39.765690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.748949Z","title":null,"venue":null,"work_id":"7715ac8c-ff59-4f5f-b66f-d6e0a0acca2f","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.626119Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:5b21554e0c77415314eb36f09b4c2bd9a3867ecd86c544a2d410f58b335e64f7","observation_id":"30c1683d-dab5-4f38-9829-ae7326836ebf","resolution":{"observed_at":"2026-08-06T18:52:39.752867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.736484Z","title":"Mitchell","venue":null,"work_id":"fe5891c5-4fe2-4ca5-9070-039a6c209a1f","year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.721352Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:708b8ed0d6a0965b6ec5e9ad5e078b9e1d579047ab1997bcf79923a207f00643","observation_id":"2d8a6005-dce8-457c-94ce-b0e00586c136","resolution":{"observed_at":"2026-08-06T18:52:39.740328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.722299Z","title":"Nock and A","venue":null,"work_id":"aef4f687-92ad-4b07-af6d-fead44394f26","year":2020},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.788286Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:3478f5257ac648964de75ec083f53654393e3142376fd9833c488e73c52974b8","observation_id":"640d0667-d9b3-4cf8-a373-16a7155fd115","resolution":{"observed_at":"2026-08-06T18:52:39.726540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.709024Z","title":"Nock and F","venue":null,"work_id":"81a5dd24-3ae6-454f-8527-abd52c2b0841","year":2008},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.854967Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:859bf752ff9dce37e9bd50ca204a1e3a9d077bd2026bae1df4c7d4fefc023864","observation_id":"47acef93-28e0-467b-8706-75b236f882bc","resolution":{"observed_at":"2026-08-06T18:52:39.713336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/tpami.2008.225","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.884196Z","title":"Nock and F","venue":null,"work_id":"225deaeb-6f2f-4e77-9bb9-c8ff8949b12f","year":2009},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:36.915265Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:db3cb7f18f55154096c4b69f164b6932abf718c65f1a5bcd3be76c8cfaaa0e05","observation_id":"19057d04-3f49-4fe8-a5dd-af41e8ea68d9","resolution":{"observed_at":"2026-08-06T18:52:38.889685Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.696114Z","title":null,"venue":null,"work_id":"9fc611a7-252d-4a7c-a9fb-fa07d445ffa6","year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.001364Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:6dc03814a29c92ed1c2475878f6484844240c6484685faa8b82f43fe43964457","observation_id":"c59ab0c2-4ffc-48e9-ba54-f641f9820612","resolution":{"observed_at":"2026-08-06T18:52:39.699922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11704","last_updated":"2024-08-06T22:37:06Z","snapshot_observed_at":"2026-08-01T16:04:10.873571Z","submitted_at":"2024-06-17T16:25:04Z","title":"Nemotron-4 340B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11704","snapshot_observed_at":"2026-08-06T18:52:37.079112Z","title":"Adler, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.079112Z"},"links":{"cited_paper":"/paper/2406.11704","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:17bbac1aaa60dc70a4c427962304eaf0b2b6aa468df7f036c7ffb53f6e7808a3","observation_id":"d48ec375-fdcf-4214-8efa-b92bb651f903","resolution":{"observed_at":"2026-08-06T18:52:37.079112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.682386Z","title":"Ouyang, J","venue":null,"work_id":"c0510872-779c-484e-9538-831bd7176c38","year":2022},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.152941Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:d079f869ffb73023e740c690925617bb5910afabbb608036d3e770795eb950eb","observation_id":"6d9a245f-f9fd-455f-8b32-49a6a3e425fb","resolution":{"observed_at":"2026-08-06T18:52:39.687241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.224508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.224508Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:7e66729152fa30f99683c6ca69eae7142d668b9ae7eee07e581ca592277bcb6a","observation_id":"b96596a0-c6c6-45de-8988-40fcf3df7371","resolution":{"observed_at":"2026-08-06T18:52:37.224508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.668872Z","title":"Rafailov, A","venue":null,"work_id":"2be91e8f-0fa9-4698-8c86-6d794128b83a","year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.280470Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:a8321d684177c9d1e394d42ba9d160ab6ed615e51f3c23466eba00c8e098fdba","observation_id":"f56d7776-02e4-497b-9014-63d4212ff29a","resolution":{"observed_at":"2026-08-06T18:52:39.673035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.655215Z","title":null,"venue":null,"work_id":"a86dca0c-4698-40f6-a6e5-ec4603dd1213","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.389498Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:cc1d587daf31b4c759a62ae56255232337c027f412e7b7384c2f621b9c2078f7","observation_id":"c9a5e42b-2936-4a46-93f6-1f6c17925fc3","resolution":{"observed_at":"2026-08-06T18:52:39.659448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.471398Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.471398Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:275936e3c3b61ad2580c8ebd79f2f13e652caa428b61a516c612de7cb38e8a5b","observation_id":"4d5ac30a-a30f-43e0-915a-d8c703a5fb74","resolution":{"observed_at":"2026-08-06T18:52:37.471398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.535852Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.535852Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:16e7bf5ee6b913b8cbfe28b5d235997a354288106740991b30b0e68c69802c26","observation_id":"cbb500e1-6af3-4c61-9eea-1934bd815d86","resolution":{"observed_at":"2026-08-06T18:52:37.535852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.642098Z","title":null,"venue":null,"work_id":"fd29cba2-dd99-4fdf-a332-b3bfd3b9f758","year":1971},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.599101Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:4beecaa928dc39b45bf49652fc7528c419757f21d87153a5868771da23375f5f","observation_id":"0d563e8f-888e-405b-992a-05b6de337c58","resolution":{"observed_at":"2026-08-06T18:52:39.646073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.629181Z","title":null,"venue":null,"work_id":"9736bb50-54c1-4c2b-a83c-0a0d6e87087b","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.665105Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:d9cb3d14f4d6b669149938f3632585a1bd041891fb1d77265270ff1084df3349","observation_id":"ac251eed-27f3-4bb2-8ba0-6b38c10425e9","resolution":{"observed_at":"2026-08-06T18:52:39.633197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.615663Z","title":"Slocum, A","venue":null,"work_id":"e2740132-93c7-4682-9cd1-962d9abdbaa4","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.723880Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:07a87a33d158d965aee53afc1b650051b62024cc9ed6461c823a4a0dbeb3c49b","observation_id":"3ce4ba05-615a-4030-be25-2691ab56a28b","resolution":{"observed_at":"2026-08-06T18:52:39.619757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.603278Z","title":null,"venue":null,"work_id":"248584f8-ac58-4672-b7c7-6731f349b697","year":2022},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.830259Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:afb8b3e95988bfedfe8f020a43216fa33a68500f2fc2892f8d19010d284d7c0e","observation_id":"8812f057-e68f-4d3e-b688-476d9e86ca73","resolution":{"observed_at":"2026-08-06T18:52:39.607057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:37.893399Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.893399Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:e8835c51af8b8d2f0ca13ac8f81dc61b16d3e87958b14bba66ef1aa4280ab8f6","observation_id":"bd040ad2-ddcd-4ea5-8881-49e96b1d3e82","resolution":{"observed_at":"2026-08-06T18:52:37.893399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.590635Z","title":null,"venue":null,"work_id":"ada110d7-1345-42eb-b85f-9da27cdeaf27","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:37.954555Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:51cd26f1a8ef48978498b156a902b34d8e68e342cfce8a0aae77380d66735e85","observation_id":"dac90df9-7ad8-44c4-9c78-95413555e016","resolution":{"observed_at":"2026-08-06T18:52:39.594541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.575910Z","title":"Sypherd, R","venue":null,"work_id":"e93c6956-b41c-49d2-b088-e425257fbca8","year":2022},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.019369Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:66af2ef348aa94b815512a4b330aa824eb6e36bac534554d4faee9bd4386282f","observation_id":"7f341fc4-d89b-4a78-bcab-887fe94274b5","resolution":{"observed_at":"2026-08-06T18:52:39.580769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.562546Z","title":"Tunstall, E","venue":null,"work_id":"8637a019-6f47-46bf-8347-dc7e8949a0fb","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.147360Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:67ad3b89059ef391bb806613cb2a6f3b2e3a81442147a76d422d043709f1e774","observation_id":"9daebe3b-71e2-4a3b-bbe4-99ffe76e8547","resolution":{"observed_at":"2026-08-06T18:52:39.566845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.547839Z","title":null,"venue":null,"work_id":"2f8435eb-fb5e-44b0-b83c-ea6569ef128d","year":2020},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.268692Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:0a6abfebf906208c418a057d48822066eec81d933996890013caefd50a0da6e5","observation_id":"88ca329d-0891-469e-9bfd-9ba8e26cdf17","resolution":{"observed_at":"2026-08-06T18:52:39.553032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.534024Z","title":null,"venue":null,"work_id":"f62edf81-a8bb-4640-b34d-d665d6be3a27","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.437209Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:bd375361b55f199340568a287d119b53c1e5ffaa2629dfb72530a6b3e1ccfc94","observation_id":"50fd11cb-35ba-45bb-bacb-9fb4b9a50010","resolution":{"observed_at":"2026-08-06T18:52:39.538286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.520397Z","title":null,"venue":null,"work_id":"2c434be5-5f2a-44c3-bd38-c3e65b111ccf","year":2016},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.563817Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:301dd7a8419af294a8db6b2e3fbf1067673e93bd06bf01a773d9e24b1586fbf2","observation_id":"bfc3f260-911f-4edc-ac4c-2c45d148e19b","resolution":{"observed_at":"2026-08-06T18:52:39.524264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.506959Z","title":null,"venue":null,"work_id":"35e263c6-e93a-41b8-8db3-ffda5e1f80ab","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.682104Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:4122a1caf18c57c224dd47b639babf20278c5c6dae3e34638df01e0ee07230bf","observation_id":"adc61e49-10df-49f2-96e6-7f0df74fd2f1","resolution":{"observed_at":"2026-08-06T18:52:39.510989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.491745Z","title":null,"venue":null,"work_id":"a3d6075a-4035-480d-ba97-eebdd7575cc8","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.778837Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:d29f2cb16fa80ede77d767bb8a4416600ab6760dfe6c83ec5ab1b2d4f90d903a","observation_id":"e22ddd89-11b9-4ec6-8db6-9870ea80c6b6","resolution":{"observed_at":"2026-08-06T18:52:39.496283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T18:52:38.783043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.783043Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:5fff3ea01f72005a267b58f444971156637dabd65169360be8a486ad35e21e88","observation_id":"08a406d6-ea26-4385-ad56-1768411060d0","resolution":{"observed_at":"2026-08-06T18:52:38.783043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.475956Z","title":null,"venue":null,"work_id":"3c19a2d4-f1a6-48e8-94a2-a26529705733","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.787672Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:26b827fa7fa8eb741a00d54e250dee094ef4a65e62059825b31296e83a8b6124","observation_id":"87803603-1cad-408c-b14e-b59054fc6f47","resolution":{"observed_at":"2026-08-06T18:52:39.480895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.461188Z","title":null,"venue":null,"work_id":"4c2fff91-ef6d-466b-9174-e1c51b96a7e5","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.791473Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:813694ab5569421606d09f5bf88cb3061cd2d1650e4d881ffda9df4722390f64","observation_id":"0881ed7b-d103-4605-bd91-21ebd84de778","resolution":{"observed_at":"2026-08-06T18:52:39.465569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.446903Z","title":null,"venue":null,"work_id":"56ea8f5d-6609-4aae-b239-592e70462723","year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.795690Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:865c6bf8f6cbd6f7b3d9e20c3fb9072c5ebbf8977f07cd7a2384ed5fdffed9a5","observation_id":"ec96c192-f2de-446e-a537-58949b0618cb","resolution":{"observed_at":"2026-08-06T18:52:39.451379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02197","last_updated":"2025-06-11T13:11:12Z","snapshot_observed_at":"2026-07-06T19:26:43.399756Z","submitted_at":"2024-10-03T04:22:55Z","title":"Beyond Bradley-Terry Models: A General Preference Model for Language Model Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02197","snapshot_observed_at":"2026-08-06T18:52:38.799899Z","title":"Zhang, G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.799899Z"},"links":{"cited_paper":"/paper/2410.02197","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:33c97a528a11c24fc1671e13f3faf28cf241e86b12dda3da4b5a5318f39a932c","observation_id":"87ebc61f-baca-466e-855a-47b090309761","resolution":{"observed_at":"2026-08-06T18:52:38.799899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.432339Z","title":null,"venue":null,"work_id":"3af1b33b-6132-4f66-9524-428b3d92ee2a","year":2025},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.804815Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:a3f3d21fea1acde74d18fc7521df9131ed01198c0b870bc4dc8523caeb50146c","observation_id":"57dd9b03-2a44-46d3-b077-a2ffcc84e3d3","resolution":{"observed_at":"2026-08-06T18:52:39.436613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-06T18:52:38.808890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.808890Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:5d49016a07c07280e0c54e7e66a3c69fa0356b855f54c7186db7cf4113239d8e","observation_id":"6b833df4-92a0-4977-88b7-29c850e08e7f","resolution":{"observed_at":"2026-08-06T18:52:38.808890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:39.417086Z","title":null,"venue":null,"work_id":"f5e130d6-8bf4-4375-b7e5-f7ab5b4605a4","year":2024},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.813440Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:e2f4a1e01e6bbf842e7096d3d6587aeb8bd51567fa7c82cc61edeebedd44d29c","observation_id":"0e55d8d0-b384-45ba-917f-38e4578e5718","resolution":{"observed_at":"2026-08-06T18:52:39.421914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.817370Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.817370Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:149a314022fa7b96f690c63ab389740aac71adb6f85a00cf56ee1e6be7ff7a9d","observation_id":"c8c75fc2-f3d9-4982-935b-29a743119ac3","resolution":{"observed_at":"2026-08-06T18:52:38.817370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.822165Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.822165Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:45398c12ed0b90276808fd15bcc8047ee0a0123b43da5efc5839598aeb88a211","observation_id":"acb13461-2315-4188-8636-15f03c2cd226","resolution":{"observed_at":"2026-08-06T18:52:38.822165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:52:38.826438Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T18:52:38.826438Z"},"links":{"citing_paper":"/paper/2507.07855"},"observation_digest":"sha256:5c65222202c61cdefe53847618ddb480cc8888f85dd3c8a3bf9e10c60432c9b5","observation_id":"df42e405-82d6-4b7c-92ba-e6aeddbf3765","resolution":{"observed_at":"2026-08-06T18:52:38.826438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07855","last_updated":"2026-06-22T14:01:09Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T03:33:35.565068Z","submitted_at":"2025-07-10T15:38:17Z","title":"DPO Unchained: Your Training Algorithm is Secretly Disentangled in Human Choice Theory (and its Loss' Convexity is Dispensable)"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":2,"verified_fuzzy":18},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 0 inbound Pith citation observations for arXiv:2507.07855."}