{"as_of":"2026-08-14T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:159c098bdfbaf48344001c298380cdeac341a18fabe06bf21cdd8c01fe84fee0","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:40:18.045861Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:11:49.149334Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:11:01.276341Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"cited_work":{"arxiv_id":"2506.07492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07492","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d9f90db0-d891-4b4c-83ea-75d22b71b2eb","year":2025},"citing_paper":{"arxiv_id":"2604.11259","last_updated":"2026-04-13T10:12:03Z","snapshot_observed_at":"2026-08-08T19:50:22.048210Z","submitted_at":"2026-04-13T10:12:03Z","title":"Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:49.149334Z"},"links":{"cited_paper":"/paper/2506.07492","citing_paper":"/paper/2604.11259"},"observation_digest":"sha256:d6990d4b39267e546302635a8185d4d0452dbbf584471bb80d76923dc18c06a3","observation_id":"8bb23c37-e426-491f-85e8-4e5cf80e523b","resolution":{"observed_at":"2026-05-11T09:11:01.282186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07492/citation-record","integrity":"/paper/2506.07492/integrity","json":"/paper/2506.07492/citation-record.json","paper":"/paper/2506.07492"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:40:17.805167Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.805167Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:d85e24004bc87dd52197a3ce9a345969d8cb6865a528ba75ebf3477f44ac6dc5","observation_id":"814c293d-8351-4c84-a266-071dd259de96","resolution":{"observed_at":"2026-08-07T05:40:17.805167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T05:40:17.810011Z","title":"Back to basics: Revisiting REINFORCE style optimization for learning from human feedback in LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.810011Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:7f1be544532ce60f991da0e7d9456f153f0e5d3dbd2d9401e65340054988c2b3","observation_id":"7733375b-fae1-45c0-94d4-4195aa3d2497","resolution":{"observed_at":"2026-08-07T05:40:17.810011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.814798Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.814798Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:bfcbfc36c2d6b07d401c9cb7c653c7fc79a1bf905b9ceced4d6e80d8a5b6972a","observation_id":"28a73e90-003e-4e7b-b6da-7f358d3c3f51","resolution":{"observed_at":"2026-08-07T05:40:17.814798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-08-14T00:29:40.101622Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-07T05:40:17.819727Z","title":"Direct preference optimization with an offset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.819727Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:ca90af3a3b9ee14dd804717807f4026612b4bfb16b245f9c86c092e13f2c7341","observation_id":"587bad29-1ff8-4a50-9e75-684abf84c47f","resolution":{"observed_at":"2026-08-07T05:40:17.819727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.824269Z","title":"G., Guo, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.824269Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:123be89d8812e0704c1cf76a7d579207c6efa17e41161065ecd668623ccc30dd","observation_id":"79c6ad72-af3f-4126-a1aa-0601e6c05547","resolution":{"observed_at":"2026-08-07T05:40:17.824269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:40:17.828666Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.828666Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:11ea7524186f5b6369431b4d48f89798078ca36dab22c725f9fc32222d12723f","observation_id":"c395d6de-c621-4c82-81ed-498728b3de65","resolution":{"observed_at":"2026-08-07T05:40:17.828666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T05:40:17.833973Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.833973Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:5c2e58584a3ef9061e27d9a0f316726ee69a9d421e6a9ee39b3a32514e1c10a1","observation_id":"946f90a8-9e91-4dea-b308-9bf73f94ebfa","resolution":{"observed_at":"2026-08-07T05:40:17.833973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.839067Z","title":"G., Bradley, H., O’Brien, K., Hallahan, E., Khan, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.839067Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:026ee256212110e8b04b903ed5affe3351f92732eadd6874c023fc45d1c369a0","observation_id":"99bb216e-2624-4f7b-be33-c84082939d0b","resolution":{"observed_at":"2026-08-07T05:40:17.839067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.967825Z","title":"and Rinaldo, A","venue":null,"work_id":"13f0e369-6ed8-4718-92ea-4dbcde4dabe6","year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.843370Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:0a9f7dacf2886a18105e66e07e4c11394324f5f97db44b06aa764567a7cc2806","observation_id":"c0ef421c-5e0e-41ef-a713-4ec9ce79430c","resolution":{"observed_at":"2026-08-07T05:40:18.973562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.848212Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.848212Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:89ac0b1a4958d830319c241196981eb5612e22f7837f54e8e03f072616bb905e","observation_id":"a615d5e9-8a6f-43da-84cd-91beb628846a","resolution":{"observed_at":"2026-08-07T05:40:17.848212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.942092Z","title":"T., Li, Y., Lundberg, S., Nori, H., Palangi, H., Ribeiro, M","venue":null,"work_id":"e972cc87-2748-4c6a-8141-43ae423de56b","year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.853062Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:5184818c67fc2ee292ac472b7e498b4ead6b2430412dc972ef1044725c1d2b07","observation_id":"d0320c2d-dee5-4d5f-b887-0426e3b56aea","resolution":{"observed_at":"2026-08-07T05:40:18.946737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.927273Z","title":"A survey on evaluation of large language models","venue":null,"work_id":"258195d5-e2d2-4075-8018-7a526c9c8bee","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.857050Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:fa7cc629f9d8d314ff90bb29a3b372e6d1ebe78a5aa1e6c713e6bea109c93f55","observation_id":"f4011480-7ab6-4093-8a94-ac2d90a9758d","resolution":{"observed_at":"2026-08-07T05:40:18.932346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09760","last_updated":"2025-03-07T15:26:03Z","snapshot_observed_at":"2026-08-12T23:42:59.282033Z","submitted_at":"2024-06-14T06:57:18Z","title":"Bootstrapping Language Models with DPO Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09760","snapshot_observed_at":"2026-08-07T05:40:17.861184Z","title":"Bootstrapping language models with DPO implicit rewards","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.861184Z"},"links":{"cited_paper":"/paper/2406.09760","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:66b70b917a6b5de86584fe4554c882a6e1ba5524077d14512e66fb2c2b8395ed","observation_id":"48ce16f0-6567-4693-b4f1-353b408a368f","resolution":{"observed_at":"2026-08-07T05:40:17.861184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.911729Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback","venue":null,"work_id":"df36d7d6-614f-4b57-87f2-31472e0daf3e","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.865832Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:582ad3a085b6786fa253919ac2c523bc4bc7aacdf6e9d373b30a82004ad397ca","observation_id":"7bcc5977-6d0d-40de-9a89-38f77c56e04e","resolution":{"observed_at":"2026-08-07T05:40:18.916344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.869779Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.869779Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:16e55db759dad3b724735619733ae6ec055d8f56000c5256ad6ed6cfb8835627","observation_id":"23d7df53-4660-4f6d-8841-aae19e1168d8","resolution":{"observed_at":"2026-08-07T05:40:17.869779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T05:40:17.873960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.873960Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:323de6af0d25a21bae5057c2966ab637f360702ec083030142b905182c1aa3be","observation_id":"b3d3c575-fa88-4367-a5b8-4c98693dcc9f","resolution":{"observed_at":"2026-08-07T05:40:17.873960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-12T21:18:02.964833Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T05:40:17.878001Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.878001Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:21c91c070812c44a5d8a3c399478b33cf1c63aa051e0236e79194fc93861afda","observation_id":"c7b3bf60-134f-42c1-a96a-de45a050d49f","resolution":{"observed_at":"2026-08-07T05:40:17.878001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04626","last_updated":"2024-04-06T13:24:37Z","snapshot_observed_at":"2026-08-13T00:35:56.015163Z","submitted_at":"2024-04-06T13:24:37Z","title":"Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04626","snapshot_observed_at":"2026-08-07T05:40:17.882471Z","title":"Towards analyzing and understanding the limitations of DPO : A theoretical perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.882471Z"},"links":{"cited_paper":"/paper/2404.04626","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:78ac540ed7d897f7225b4fcbd7c79b22b97e749861f6d23efb8fbec0d8dba395","observation_id":"29c4a37d-1f34-468f-90e3-68cb338f922a","resolution":{"observed_at":"2026-08-07T05:40:17.882471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00770","last_updated":"2024-07-12T20:29:57Z","snapshot_observed_at":"2026-08-14T06:02:46.015317Z","submitted_at":"2023-09-02T00:32:55Z","title":"Bias and Fairness in Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00770","snapshot_observed_at":"2026-08-07T05:40:17.886568Z","title":"O., Rossi, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.886568Z"},"links":{"cited_paper":"/paper/2309.00770","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:95388216a340d1452e3250f30a200413c310103a1b560299f0bb4042c0cb3f1d","observation_id":"9ac79af2-8955-4e80-8e72-19b881aba6d1","resolution":{"observed_at":"2026-08-07T05:40:17.886568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-13T10:17:00.791443Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T05:40:17.890649Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.890649Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:ef6557858be5eefd225d7572012a1cfab2e2bd090a73a5839143ebc197aa7298","observation_id":"ee9c6377-7ddb-4e9b-8ca8-df6af4d58ad9","resolution":{"observed_at":"2026-08-07T05:40:17.890649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09656","last_updated":"2025-02-25T10:19:35Z","snapshot_observed_at":"2026-08-13T14:21:51.626111Z","submitted_at":"2024-04-15T10:44:31Z","title":"Learn Your Reference Model for Real Good Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09656","snapshot_observed_at":"2026-08-07T05:40:17.894671Z","title":"Learn your reference model for real good alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.894671Z"},"links":{"cited_paper":"/paper/2404.09656","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:f560a47dad00ac32fb7b1e5dca00012ff2e248e334a8cc2f089e2ebebe5552c9","observation_id":"9bf454c0-d0c9-470b-99ac-b9b245bc4f18","resolution":{"observed_at":"2026-08-07T05:40:17.894671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.885448Z","title":"and Pierskalla, W","venue":null,"work_id":"5ed7e5db-3010-4f80-a909-f0fe619be947","year":1971},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.898762Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:24af433dad519761810674d1324c9bd50bb98b372e20864481f290310430da4e","observation_id":"186c1af7-8365-4919-945b-3665b82d0bcd","resolution":{"observed_at":"2026-08-07T05:40:18.890064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:40:17.902738Z","title":"Deepseek- R 1: I ncentivizing reasoning capability in LLM s via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.902738Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:119385d5bc85092a54a6660468a1ab6baa293b9c1c5c6336e2121ebb9ca4f7b5","observation_id":"69ecbe00-bcf7-4428-91ab-5fbd69ed5fa4","resolution":{"observed_at":"2026-08-07T05:40:17.902738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-08-13T04:59:53.332269Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-07T05:40:17.906760Z","title":"Orpo: Monolithic preference optimization without reference model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.906760Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:5c8a51ff252415d8de9cafaf048aaa0ab663f36d27c5372cf443fe5c3f18c2d4","observation_id":"e897ace9-7697-498a-ba60-dd00acfaa9c8","resolution":{"observed_at":"2026-08-07T05:40:17.906760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18742","last_updated":"2024-08-06T22:33:26Z","snapshot_observed_at":"2026-08-13T00:43:40.370907Z","submitted_at":"2024-03-27T16:39:28Z","title":"Understanding the Learning Dynamics of Alignment with Human Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18742","snapshot_observed_at":"2026-08-07T05:40:17.910923Z","title":"and Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.910923Z"},"links":{"cited_paper":"/paper/2403.18742","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:47c0db716fe390ceec185c95bd0befadf8356f293d845d77d66bb5b6d378e0cb","observation_id":"e1a6ffa6-1c87-438c-9b8e-5c3b6a11a067","resolution":{"observed_at":"2026-08-07T05:40:17.910923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.870677Z","title":"https://github.com/huggingface/trl/pull/1265","venue":null,"work_id":"cfa26430-10b7-421a-abd7-77b6e8ea3669","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.915435Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:149184fe492765b160816d16873e1262022af173b1a229bc7b4765974e97c8e2","observation_id":"d6a10d37-3832-4f5e-b2e4-bf3e7bf18d1e","resolution":{"observed_at":"2026-08-07T05:40:18.875095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T05:40:17.920012Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.920012Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:b1f0aa1b53e0789da704200da1bcaa6b2d8e9ed90b881212577b41c756d5b834","observation_id":"65a14ff0-d858-4efd-8bd0-57f9600c6629","resolution":{"observed_at":"2026-08-07T05:40:17.920012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.856146Z","title":"Common learning constraints alter interpretations of direct preference optimization","venue":null,"work_id":"df54d471-b747-4435-bdbc-c40c92308fc3","year":2025},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.924252Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:afc470f1052c3a87189ca3e095be796a959e79a8d3c8109452f8d49e5717a049","observation_id":"8dba99e6-d37a-40a8-8f2b-710645e6e6eb","resolution":{"observed_at":"2026-08-07T05:40:18.860673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.928495Z","title":"H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.928495Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:fcf3364a01b0376af12a41ba9ffcf987e1d4278a298a5810acf771a8433fc613","observation_id":"06e98cfe-841e-411d-b3be-83c479524cec","resolution":{"observed_at":"2026-08-07T05:40:17.928495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.933007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.933007Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:97b3fc0b9c09e4a92dff7ce7a23a778b1052887f596a80e32115197db1dd8b92","observation_id":"9daa881e-8c3b-4878-b8ce-b212ac68cc8f","resolution":{"observed_at":"2026-08-07T05:40:17.933007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10584","last_updated":"2024-02-25T19:15:26Z","snapshot_observed_at":"2026-08-13T05:00:13.831621Z","submitted_at":"2023-12-17T02:14:15Z","title":"Policy Optimization in RLHF: The Impact of Out-of-preference Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10584","snapshot_observed_at":"2026-08-07T05:40:17.937230Z","title":"Policy optimization in rlhf: The impact of out-of-preference data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.937230Z"},"links":{"cited_paper":"/paper/2312.10584","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:1cc8bb9d85c43b7a3d94d556241104c7e130ba5c47928f47a0fdcbe749d54ab4","observation_id":"b7c6d022-71b5-42c7-90d9-c7b5bcbd23f7","resolution":{"observed_at":"2026-08-07T05:40:17.937230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03650","last_updated":"2024-10-03T17:13:04Z","snapshot_observed_at":"2026-08-13T03:29:53.453904Z","submitted_at":"2024-09-05T16:08:19Z","title":"On the Limited Generalization Capability of the Implicit Reward Model Induced by Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03650","snapshot_observed_at":"2026-08-07T05:40:17.941137Z","title":"On the limited generalization capability of the implicit reward model induced by direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.941137Z"},"links":{"cited_paper":"/paper/2409.03650","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:c1f7bc606b59e7a60b7eb6852aefccb9a2c099341301837ae74f9088bd61ed68","observation_id":"08f0ace7-0ead-474d-aaaf-3a7fb6b1e2fe","resolution":{"observed_at":"2026-08-07T05:40:17.941137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.820046Z","title":"L., Daly, R","venue":null,"work_id":"7999335f-3688-48fb-8882-dd088a865de6","year":2011},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.945451Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:d201a1e9c17cbf064d637dcfc0c4e8e10ec9d337569cf26e402ba1bd89a32003","observation_id":"9735fcff-1b7a-4138-b7d9-0ee2d8104416","resolution":{"observed_at":"2026-08-07T05:40:18.825067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-12T23:59:40.308872Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T05:40:17.949816Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.949816Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:5e8301e3d260b5142a787a31b3746f62da6de8813b022ca5619d2e624e6a6b8b","observation_id":"3eaad74c-b477-4f61-ad2d-2514ce7af7ab","resolution":{"observed_at":"2026-08-07T05:40:17.949816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08114","last_updated":"2024-06-28T08:22:01Z","snapshot_observed_at":"2026-08-13T04:20:10.808198Z","submitted_at":"2024-02-12T23:09:00Z","title":"Active Preference Learning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08114","snapshot_observed_at":"2026-08-07T05:40:17.953985Z","title":"Active preference learning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.953985Z"},"links":{"cited_paper":"/paper/2402.08114","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:b8c2fcb3c5f6b1adab807e47c6c8def95df0a703430e91b47c076e306a26bcbc","observation_id":"a4d29e7f-976f-40d7-9278-28a683cbe2cb","resolution":{"observed_at":"2026-08-07T05:40:17.953985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.958243Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.958243Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:c6267148870a012276748b6185ad6157a85c342ec751218890d3001815fd8faf","observation_id":"31a19b43-e3f6-46ee-8746-81b6e9241408","resolution":{"observed_at":"2026-08-07T05:40:17.958243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-07T05:40:17.962472Z","title":"Smaug: F ixing failure modes of preference optimisation with DPO -positive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.962472Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:e73dbffe92db532e2a182efd9da4e06f0dfe69850a44a937ca4d9505c0ed602f","observation_id":"59fc338f-5672-41ee-81f7-61e83c74674c","resolution":{"observed_at":"2026-08-07T05:40:17.962472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-13T00:43:17.870166Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-07T05:40:17.966403Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.966403Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:9f814c30b95cf0271c918d0da233b11a2e40d3414ad5208b9dbad3b7c95811dc","observation_id":"2444c89a-c34f-44c2-a429-af7a17a9eb79","resolution":{"observed_at":"2026-08-07T05:40:17.966403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T05:40:17.970581Z","title":"B., Kumar, A., Zhang, G., and Levine, S","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.970581Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:21ecafd16fea7093ed0eaff81c5de56f9faa3627434419d35d29e8a57163efcb","observation_id":"491e4e82-0774-4f99-87e1-63e182a5feaa","resolution":{"observed_at":"2026-08-07T05:40:17.970581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.795590Z","title":"and Schaal, S","venue":null,"work_id":"40cbb08a-ff7a-4572-a507-0babd64997dd","year":2007},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.974749Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:600c9842fdaf4e8f38bfeabf70a027fc68318d5d2a416f8ea5207f2e1bbeae30","observation_id":"8aa11bc4-da3e-4fd0-9bad-4b0f8063e226","resolution":{"observed_at":"2026-08-07T05:40:18.799960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:17.978690Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.978690Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:b8aa7d5511005296dcf2fa79b205500524ff9f7a24be99d82f75e53de84c8bef","observation_id":"1b783b59-d2c2-4763-b8b5-40991e1dd7b1","resolution":{"observed_at":"2026-08-07T05:40:17.978690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01241","last_updated":"2023-03-01T01:31:17Z","snapshot_observed_at":"2026-08-13T14:13:47.166200Z","submitted_at":"2022-10-03T21:38:29Z","title":"Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01241","snapshot_observed_at":"2026-08-07T05:40:17.982800Z","title":"Is reinforcement learning (not) for natural language processing: Benchmarks, baselines, and building blocks for natural language policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.982800Z"},"links":{"cited_paper":"/paper/2210.01241","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:c6f0638dc768f972c4249ee951f9dd987f25a14962a7024d474bdf3ca94e057a","observation_id":"e4315a4d-6138-4a5e-a77a-56c8f4f8748a","resolution":{"observed_at":"2026-08-07T05:40:17.982800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.770007Z","title":null,"venue":null,"work_id":"02004aaa-aa99-4656-91bd-40bc9baf6e83","year":2019},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.987548Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:86f86c87b7bbeec9b4607e941d1022938b2995fe765d2b8d4b81406c02f40e25","observation_id":"d7a20d07-a754-48c3-9370-5e3d676483f5","resolution":{"observed_at":"2026-08-07T05:40:18.774723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:40:17.991410Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.991410Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:342e1c5c3eb8d94da50b9d5e4fc6eabcc40f6104e4cd81c28623ae8087708a72","observation_id":"62dbb63e-f8b3-434a-8ba4-510035797112","resolution":{"observed_at":"2026-08-07T05:40:17.991410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:40:17.996101Z","title":"Deepseek M ath: P ushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.996101Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:7a5e2b80f25f0872cb59eed8c5d43acfdabe9451d7822831a69aaef63f9f815d","observation_id":"9f0c31c3-9de9-486f-a220-7e3369074278","resolution":{"observed_at":"2026-08-07T05:40:17.996101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.755888Z","title":"The importance of online data: U nderstanding preference fine-tuning via coverage","venue":null,"work_id":"1554cc14-edff-40b6-ba7f-a94d6ced64f4","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.000075Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:a500a01920902c751d2eb1337a51b657414434fde8072f3da355d5de318d20c5","observation_id":"1e8ed1e2-e9a0-46cb-861c-81de59126bae","resolution":{"observed_at":"2026-08-07T05:40:18.760164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.740610Z","title":"M., Lowe, R., Voss, C., Radford, A., Amodei, D., and Christiano, P","venue":null,"work_id":"2e5ced1b-07be-4924-96c4-09d5a8032247","year":2020},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.004100Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:709156f43cc14c229e6d04b3e93a60e52e029c0903940cef21d46fa6ebdefd10","observation_id":"bf476f93-313a-4550-9249-1b0ca218ec18","resolution":{"observed_at":"2026-08-07T05:40:18.744990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.008082Z","title":"S., and Bagnell, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.008082Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:c2479a53ff80374bc1684274d0db6abb571f5826261bb607e2d1b6cafc9296d0","observation_id":"ab772d2f-269f-40f3-bd2f-4188f6b385f7","resolution":{"observed_at":"2026-08-07T05:40:18.008082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14367","last_updated":"2024-06-02T22:00:42Z","snapshot_observed_at":"2026-08-13T06:40:27.614915Z","submitted_at":"2024-04-22T17:20:18Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14367","snapshot_observed_at":"2026-08-07T05:40:18.011912Z","title":"Preference fine-tuning of LLM s should leverage suboptimal, on-policy data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.011912Z"},"links":{"cited_paper":"/paper/2404.14367","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:f40e29d61d8454c420a24c2cb7444875135f2fc0516381711fe2f79d5c8e850e","observation_id":"c06bc6f8-2862-4405-a46a-971305cb837d","resolution":{"observed_at":"2026-08-07T05:40:18.011912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05749","last_updated":"2024-05-28T23:25:15Z","snapshot_observed_at":"2026-08-13T04:23:18.212697Z","submitted_at":"2024-02-08T15:33:09Z","title":"Generalized Preference Optimization: A Unified Approach to Offline Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05749","snapshot_observed_at":"2026-08-07T05:40:18.016343Z","title":"D., Zheng, Z., Calandriello, D., Munos, R., Rowland, M., Richemond, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.016343Z"},"links":{"cited_paper":"/paper/2402.05749","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:e42e15a69dd0ae386a237055afa0bbe9c88c17efb7d9a40024d34ca107addf6b","observation_id":"6bf9cade-a35f-49df-802a-f4f1d1c79197","resolution":{"observed_at":"2026-08-07T05:40:18.016343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.723355Z","title":"Beyond reverse KL : Generalizing direct preference optimization with diverse divergence constraints","venue":null,"work_id":"7f100fe6-4845-4f83-8313-6352f32b917a","year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.020516Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:7c9c789cf3aa944f2f996f126610e6d562a19e34eb1ae326bd56449aabe5686e","observation_id":"1b95adbf-7431-45c7-ada4-c04e01e142f6","resolution":{"observed_at":"2026-08-07T05:40:18.729750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-08-12T23:40:45.676888Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-07T05:40:18.024969Z","title":"Y., Xu, N., Zhang, S., Poon, H., and Chen, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.024969Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:354153b381aab9bf29692a02b59539ec50c6934410288fa9ca8507c1701c8a11","observation_id":"88349501-5533-413c-8a10-33c1c19c004b","resolution":{"observed_at":"2026-08-07T05:40:18.024969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-08-13T06:40:10.732455Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-07T05:40:18.028816Z","title":"Is DPO superior to PPO for LLM alignment? A comprehensive study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.028816Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:8e86d3002dee921eedac37bf1e3f461900287371c2b0d4d954ca641efe5b7eb0","observation_id":"a7cab4d7-a511-4c0c-860c-3f7a5215f708","resolution":{"observed_at":"2026-08-07T05:40:18.028816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T05:40:18.033007Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.033007Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:7db3572f098595ff9bab8b10bdc721cf46a4edcf37e8001d2c5c5cd08824169e","observation_id":"3613ae8d-bd79-4c5b-9de9-0ce589cb6c87","resolution":{"observed_at":"2026-08-07T05:40:18.033007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-13T11:40:02.795309Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T05:40:18.036861Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.036861Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:b174d9300bca7a02be8637e735598bc33e0c4cfe48ae409732861b6204a97639","observation_id":"96a4e02e-511b-44ed-9d04-e4057629f929","resolution":{"observed_at":"2026-08-07T05:40:18.036861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-11T04:34:07.318549Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T05:40:18.041204Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.041204Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:6e4e128032395456145f0df4723fbd31adccc7d8bf6c7ca6f55047469d58d442","observation_id":"05aafb46-278e-4a2c-b53c-2bf326be5b86","resolution":{"observed_at":"2026-08-07T05:40:18.041204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:40:18.045861Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:18.045861Z"},"links":{"citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:ff9f23094a588c2b827168922f58234fe35922a56acb5378bdd791934e21920e","observation_id":"bc3da6ce-ceed-4082-a2d3-b4792f7fe476","resolution":{"observed_at":"2026-08-07T05:40:18.045861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T02:43:19.995015Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2506.07492."}