{"as_of":"2026-08-21T03:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c675b8cc55ee3e105e8477f367ab53f950b7efde9a006cfd8d230272809cc8ef","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:40:51.092593Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12435/citation-record","integrity":"/paper/2505.12435/integrity","json":"/paper/2505.12435/citation-record.json","paper":"/paper/2505.12435"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.787555Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.787555Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:1f302a9a765461502a3fed3adffeafcac633749a4f4f2dfba6c36bec5de3a838","observation_id":"3daead4f-b2b8-4a69-986a-f40a5f44846a","resolution":{"observed_at":"2026-08-15T20:40:50.787555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.792034Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.792034Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2956517ea3005967d525209cf8bb4f43ac9622a9617803db940041052f518e69","observation_id":"471db8dc-dc7a-4efc-ae10-251227468576","resolution":{"observed_at":"2026-08-15T20:40:50.792034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.798147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.798147Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:cd02f25e5615175037e11b35b2ebc8d440060e4e5e1b4cb1d3bac10f7cf45b18","observation_id":"242e1644-c186-499d-8257-06c3c33462bc","resolution":{"observed_at":"2026-08-15T20:40:50.798147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.802374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.802374Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:36ce1d30fca04bbf5ee2cc110fda97d8f3b6c5a00856b64109f93b9f944302ef","observation_id":"eb030c38-f58d-4ec7-acc3-9d46281e1ff9","resolution":{"observed_at":"2026-08-15T20:40:50.802374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-20T10:43:00.063759Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-15T20:40:50.806492Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.806492Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:f463cf1fd1a29f2797f29a63f898bdb2e2f7bd50122cdd76ff2832d80d7950f7","observation_id":"15c011cf-db3a-4cb5-be37-336a26bf220c","resolution":{"observed_at":"2026-08-15T20:40:50.806492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T20:40:50.810310Z","title":"Brown, Jack Clark, Sam McCandlish, Chris Olah, Benjamin Mann, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.810310Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0890114ae34de1a1dca7683ffe28a836b33e536ad1cc071e9185af7cc4fb8237","observation_id":"4f1163fb-4054-4734-b9d2-c770d6a7843f","resolution":{"observed_at":"2026-08-15T20:40:50.810310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-15T20:40:50.814418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.814418Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:84898697570dd12703f4bf8112a603d9326be69b2e09b329b3d350bc1063fe7a","observation_id":"cb26f0d1-c64b-4224-a5c6-a1293c47d654","resolution":{"observed_at":"2026-08-15T20:40:50.814418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.198342Z","title":null,"venue":null,"work_id":"f83b63af-0ba1-4f62-aff7-bd428c330e5e","year":2020},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.818145Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:44d1e69dad6699c53db7e14b68cc24a242a16cfbd755632acc15fd4977ac4a70","observation_id":"50cb692c-a232-41fa-ab4e-baea64a1708d","resolution":{"observed_at":"2026-08-15T20:40:52.202520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.181884Z","title":null,"venue":null,"work_id":"7cba1f9e-3ae2-4a59-91c6-126e2c7231d5","year":1952},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.821666Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:750b75109f9297affb1e448261f255adb5a28490a78f4e217bf313ad13cbc3a4","observation_id":"e7c1db1a-76ad-4499-b186-915f89c90781","resolution":{"observed_at":"2026-08-15T20:40:52.188957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.163180Z","title":null,"venue":null,"work_id":"e78bb39a-75b6-49ef-9f46-646b31a44212","year":1952},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.825083Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0a358d4e2166a4c7da2399ee7110098bcad7638b7fa2850df098c465a1e18d06","observation_id":"6dcde4ba-4f9d-4f36-bff6-14f2ee10ce64","resolution":{"observed_at":"2026-08-15T20:40:52.169980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.149131Z","title":"Sheng, Huaiyu Dai, and Dejing Dou","venue":null,"work_id":"dd706ec0-cbb2-4ab7-a25f-144bdb59aa18","year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.828658Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:ad44151a3c29c38fa1bce9196bf9d9ac155828c2a3bb9e8dbc1b73643938c3c3","observation_id":"8c1eb1aa-7c0f-4795-9129-1c93642ab4f3","resolution":{"observed_at":"2026-08-15T20:40:52.154030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.136306Z","title":null,"venue":null,"work_id":"64d0de99-3871-4df8-aa75-204fcdd7d22b","year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.832240Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:d9ff201c3276dee054e0ab293fbfd3ff644050e7b1391af36c81bf967fac82e7","observation_id":"5bce26c4-f3eb-4eab-9a1f-d769ef985db7","resolution":{"observed_at":"2026-08-15T20:40:52.140887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05369","last_updated":"2024-10-30T07:29:40Z","snapshot_observed_at":"2026-08-16T14:20:22.893368Z","submitted_at":"2024-02-08T02:58:47Z","title":"Noise Contrastive Alignment of Language Models with Explicit Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05369","snapshot_observed_at":"2026-08-15T20:40:50.836712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.836712Z"},"links":{"cited_paper":"/paper/2402.05369","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:14c294b2bb9a2da734556114bab2e7dd9782c5b26f29b6733d04afca07962d2f","observation_id":"116b5ec6-b7b1-4a06-a2f3-92de6de188de","resolution":{"observed_at":"2026-08-15T20:40:50.836712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T20:40:50.840423Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.840423Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:1502c87596dd5dacbb35535b9f97c25024aa9d3dc415c97f90ca66d3212ca07a","observation_id":"94b237cb-c520-4d8e-ac12-01df6f1c74ad","resolution":{"observed_at":"2026-08-15T20:40:50.840423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T20:40:50.844143Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.844143Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:df25afe4e2491fb4810ffb1b2a5a762dff53ab67790983c7f99d3abd1cf22646","observation_id":"a6d4f618-b656-4312-beb0-5df380dd9ed3","resolution":{"observed_at":"2026-08-15T20:40:50.844143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-15T20:40:50.847988Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.847988Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:c2596e7f8fff0ce4bcf238712691a071872524f8a57c7fd0ce39af5dd62382c6","observation_id":"59f474a5-f2d2-46a8-afa8-4ca17752d813","resolution":{"observed_at":"2026-08-15T20:40:50.847988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:40:50.852840Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.852840Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2ceac99359b088869b28ed184fb93ff80414c3671efd99b467678c0866851f3a","observation_id":"f473829f-c119-4b41-816d-8ea4ab4ef353","resolution":{"observed_at":"2026-08-15T20:40:50.852840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-18T05:06:04.678949Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-15T20:40:50.856604Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.856604Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:083a3e17132511d0dba90f4d0e0df5fbf4bbad7c572193ccc37ababe4de49cab","observation_id":"2c946d99-1fd2-4baa-a825-94d7a8028475","resolution":{"observed_at":"2026-08-15T20:40:50.856604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-15T20:40:50.861519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.861519Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:7f1166768552a9896724d89a3020d01f578ed551bfdab93c9577f52cf86ee04d","observation_id":"ecb7e8e0-9952-40de-985d-ba8bbeacb3b9","resolution":{"observed_at":"2026-08-15T20:40:50.861519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14387","last_updated":"2024-01-08T04:46:56Z","snapshot_observed_at":"2026-08-21T01:13:54.553878Z","submitted_at":"2023-05-22T17:55:50Z","title":"AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14387","snapshot_observed_at":"2026-08-15T20:40:50.867012Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.867012Z"},"links":{"cited_paper":"/paper/2305.14387","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:e1714af2efbc0565be53ca6989e2e633076acb0c0bb37f10c7048143b4c213e1","observation_id":"def4e0e7-5314-4c03-98aa-0e9226a715c1","resolution":{"observed_at":"2026-08-15T20:40:50.867012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.117852Z","title":null,"venue":null,"work_id":"28c87698-8dc3-43dc-8753-0325114a1e4c","year":2020},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.873915Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2c034304e05a208a133a56e4c230786bac5a6e3b3ba6b0c530d8e7d2dcb48cfc","observation_id":"63efa318-3e9b-4326-8878-ef7c58462398","resolution":{"observed_at":"2026-08-15T20:40:52.126768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-15T20:40:50.878800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.878800Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0391a04464d5d25c91d3d7f67e75cbfea4a2b3bec5efefcf63516c6bb6b10f6c","observation_id":"dc60c685-346b-4bfd-84ad-f9d20e27992f","resolution":{"observed_at":"2026-08-15T20:40:50.878800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04626","last_updated":"2024-04-06T13:24:37Z","snapshot_observed_at":"2026-08-16T14:03:07.999935Z","submitted_at":"2024-04-06T13:24:37Z","title":"Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04626","snapshot_observed_at":"2026-08-15T20:40:50.883420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.883420Z"},"links":{"cited_paper":"/paper/2404.04626","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:e97a60483aeb71482d4c8083a7fd54fb80f98b8d193777f0238cf4f6930f1d9c","observation_id":"7a277e6e-d56e-45de-8967-eb401de4836a","resolution":{"observed_at":"2026-08-15T20:40:50.883420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.103040Z","title":null,"venue":null,"work_id":"6ac2e24b-dfb2-4b6b-8448-a17a9130d107","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.888201Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:afdf0c47a90f60ab8980201c3fa581594532df11b357b989dc195c36e7477564","observation_id":"33fdbbea-461d-46bb-a380-38e669142bb2","resolution":{"observed_at":"2026-08-15T20:40:52.107987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.086798Z","title":null,"venue":null,"work_id":"fefa0426-18ee-4101-af91-a039b16b5e63","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.892378Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:cf110962872b67e1f48314b77a3c70b449ba090a8b60c9fb8cda8d5ca0aa7821","observation_id":"f4dfa443-3d81-45fb-9ef8-cdc03312dd05","resolution":{"observed_at":"2026-08-15T20:40:52.092389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T20:40:50.898674Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.898674Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:04378f823adc583cce0833b7fc35180e1180223be2974bb383d7a54723bff827","observation_id":"63839f5a-2dcf-4b47-84ee-314c01a29507","resolution":{"observed_at":"2026-08-15T20:40:50.898674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.057557Z","title":null,"venue":null,"work_id":"8aa2dcc0-5d28-495e-9aa0-8b4a574f0b69","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.903456Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:a7abf2135b91b6c4c523ac43b83570c02be11b965003d7a03369c601bc5fd07d","observation_id":"bbb0a843-c63b-4c3f-872b-a31894efb4ca","resolution":{"observed_at":"2026-08-15T20:40:52.064819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00934","last_updated":"2024-04-03T17:04:06Z","snapshot_observed_at":"2026-08-16T14:04:44.599558Z","submitted_at":"2024-04-01T05:39:36Z","title":"ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00934","snapshot_observed_at":"2026-08-15T20:40:50.907728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.907728Z"},"links":{"cited_paper":"/paper/2404.00934","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:9d29ccb0456b6f689748457d3fa52604aa5f161e041d41b3cf81bb44faaf9589","observation_id":"e737e666-7a83-4300-9e3b-36e2ea3d1156","resolution":{"observed_at":"2026-08-15T20:40:50.907728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.042951Z","title":null,"venue":null,"work_id":"3eb92cdb-909b-4be2-9f35-9d9fb2f6725b","year":2020},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.913755Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:52cf7e5e60856aeef82a1b3548125338789bc91ef93d63b11e2c85d6f0903cf8","observation_id":"64091380-0c4d-499a-88c7-2cc65c665442","resolution":{"observed_at":"2026-08-15T20:40:52.048184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.030715Z","title":null,"venue":null,"work_id":"f00a3a70-fa27-419f-b595-4f8e1d80dd4d","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.917328Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:37bc8ba96dc03ed38ccf5f10a496fa797a82b5f5d0ceba9865ba6858524e3e2b","observation_id":"3d22dd6d-a93d-4c10-8afa-804870a03e2d","resolution":{"observed_at":"2026-08-15T20:40:52.034963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04656","last_updated":"2025-06-09T07:10:33Z","snapshot_observed_at":"2026-08-19T04:57:34.223598Z","submitted_at":"2024-04-06T15:20:59Z","title":"Binary Classifier Optimization for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04656","snapshot_observed_at":"2026-08-15T20:40:50.925689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.925689Z"},"links":{"cited_paper":"/paper/2404.04656","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:6fd13e8f51283917470d59c9d6c0a44aebecae13ed0369e239455ea031705367","observation_id":"47a23641-f57b-43d9-9f82-e236fe6762c5","resolution":{"observed_at":"2026-08-15T20:40:50.925689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.930298Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.930298Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:e0ac6842cecd5b72e05e4f421ae50dad5c60ed6ba2d866d81ed4d999f8378c0e","observation_id":"86856a6b-6237-4af2-9633-b6e380071d78","resolution":{"observed_at":"2026-08-15T20:40:50.930298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.934357Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.934357Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:bbe6da81592d6226cbe880d42c939081adda9c1c41c065c5da393381a738885d","observation_id":"6aa1d5a6-01f1-4674-ade9-824e5f66bcac","resolution":{"observed_at":"2026-08-15T20:40:50.934357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.992829Z","title":null,"venue":null,"work_id":"fa8da84a-0d36-430c-b0ec-dafce9f8fdb8","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.938542Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:3baf56ee85c6ec4fe98601c9bf232eb5c1fceec319c26fe6637fef1f299692da","observation_id":"fb60a56a-9752-4689-b4d8-4aafc65577d5","resolution":{"observed_at":"2026-08-15T20:40:51.997053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.971442Z","title":null,"venue":null,"work_id":"47267351-96bc-4cab-b6fe-bbf8ca91cdc9","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.942801Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:5414cc3d83ac569c907e755522f731de4a429f5cc5f6d8ffdeb4afc343ac1ac1","observation_id":"def9d6f1-f470-4624-9326-390d6ca74ff0","resolution":{"observed_at":"2026-08-15T20:40:51.977717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.956448Z","title":null,"venue":null,"work_id":"756b0ac1-6a22-4c57-add3-b4a4bc0aed99","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.946587Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:bf090c79d58fb094afa7fda3debadc7b611dba365460f261a54452859103584d","observation_id":"09bb4ae4-c9ce-4606-b18d-37193864672d","resolution":{"observed_at":"2026-08-15T20:40:51.962086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.941316Z","title":null,"venue":null,"work_id":"7c216f2d-f1c7-4967-a03e-b00600da4178","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.950791Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:6ef9af6b1665c9df19c04d75b8c369c650b08cbb1bbc1879d8f8c7402d12c3b1","observation_id":"1e676ca6-5bdd-43f4-8a58-c7692a3e7ea6","resolution":{"observed_at":"2026-08-15T20:40:51.947236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.928386Z","title":null,"venue":null,"work_id":"92e87d53-f359-4d33-aeff-b553138eff87","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.954528Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:7b7829a19662671080ace5d0cdf345bf2a848c86e17ed3606d0e82d3af61a0c2","observation_id":"c00ec4d0-b2ef-47a8-89a7-c607f7bf04b7","resolution":{"observed_at":"2026-08-15T20:40:51.932469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.913335Z","title":null,"venue":null,"work_id":"36d23ac1-9bdc-4d7c-b67d-8c1fd4db568f","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.958054Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:41e2f9d8fc2eb640bc775cd3524962184a69e3c12bc1bcc292bf66c266e9364a","observation_id":"0e12d145-60b5-4f3c-9dbe-a0d5970f7689","resolution":{"observed_at":"2026-08-15T20:40:51.918412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.892809Z","title":null,"venue":null,"work_id":"f6d12b82-3d54-471e-983d-27971ccf22f5","year":2015},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.962897Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:ebc9ac90e7a28c081cd09dada2a82677b098c538c10bf7d2a626182189d2e427","observation_id":"84318b56-4c45-4301-9e8b-d638dcc0259f","resolution":{"observed_at":"2026-08-15T20:40:51.897471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.877526Z","title":null,"venue":null,"work_id":"731f155b-71b3-4845-9355-3243b95c020b","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.966934Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:f57b3f48895d6a09142514072942625c0497e5af776914ed3234ec1f8ab1960e","observation_id":"77eb1868-571e-4e4b-af4a-1eff649fad8c","resolution":{"observed_at":"2026-08-15T20:40:51.882737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.859857Z","title":null,"venue":null,"work_id":"2e588470-3aac-450d-a0d9-8042d4f7783d","year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.972276Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:6077ac1e25f10b94debea349b77f1ec5edf9174fd6d4b79178bade88ba1b1276","observation_id":"965d54b0-6259-4bf6-8fca-4ef0fe17f6b9","resolution":{"observed_at":"2026-08-15T20:40:51.864918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.847052Z","title":null,"venue":null,"work_id":"a003f74f-06fa-4025-b965-19e697a82468","year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.977632Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:a59409132eb5f06332008efe65d30ebfcf8dd77e631f588f2ca7e938dae122e6","observation_id":"942fabb0-3d12-44be-a1cb-3daa306aa7d5","resolution":{"observed_at":"2026-08-15T20:40:51.851855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.982935Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.982935Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:68718e26125be4dab38cb545f80df8969d6e280a6345eb5ecc29bf1b3c64cc04","observation_id":"74d4375e-5068-4b24-91ed-3e739cd9342e","resolution":{"observed_at":"2026-08-15T20:40:50.982935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06411","last_updated":"2024-11-28T02:53:40Z","snapshot_observed_at":"2026-08-16T17:29:35.207164Z","submitted_at":"2024-09-10T10:49:38Z","title":"Length Desensitization in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06411","snapshot_observed_at":"2026-08-15T20:40:50.986937Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.986937Z"},"links":{"cited_paper":"/paper/2409.06411","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:effa02a99a77815ca0434b8f717eeea70eb79c22afd7e7e5ea369372b655c27c","observation_id":"5e656f0a-fbf1-482a-b962-e892415a274b","resolution":{"observed_at":"2026-08-15T20:40:50.986937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10957","last_updated":"2024-12-09T09:57:05Z","snapshot_observed_at":"2026-08-20T07:47:07.801206Z","submitted_at":"2024-06-16T14:24:30Z","title":"Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10957","snapshot_observed_at":"2026-08-15T20:40:50.995488Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.995488Z"},"links":{"cited_paper":"/paper/2406.10957","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:5ecd87c94dad6f88df15c94cb0e44a3a1f54f578c68946da7e837e7c3f0233fa","observation_id":"1b480cfa-c648-4d8d-bf96-ab522ba28b53","resolution":{"observed_at":"2026-08-15T20:40:50.995488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.828836Z","title":null,"venue":null,"work_id":"20fa8651-9a54-424f-bac5-35375ce6a72a","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.000659Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:25ea3b3ef7d8ca878ddf99c8894dbef10b7083d153624793700b4d775fd8cf25","observation_id":"12f518c5-463d-403e-a1ca-bd2d435be68f","resolution":{"observed_at":"2026-08-15T20:40:51.834403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:40:51.008119Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.008119Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:510d5c75503224b5d2514b7af7176425f131d6183b45f6685ffd59a7a27e9c7c","observation_id":"92a9f314-f8e1-4876-961a-abe8abd24226","resolution":{"observed_at":"2026-08-15T20:40:51.008119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.013546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.013546Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:4695d7f83de53a027aa6c85e89770ff939bbf57c16328f18ec54c9badfeb6eda","observation_id":"cb16990e-0a17-481b-b1cd-b241535b1e41","resolution":{"observed_at":"2026-08-15T20:40:51.013546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.803786Z","title":null,"venue":null,"work_id":"54bb1e9b-8cd2-47de-8060-4fb7cbf55900","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.017748Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:cc4bb41e7e16e196f44351b01d2ccaf01fac4bba75a6c5a7e3b2c2c6f542e6a8","observation_id":"e8b78292-e152-469a-a2af-8456842ab2a8","resolution":{"observed_at":"2026-08-15T20:40:51.809529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-15T20:40:51.022359Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.022359Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b05b4a65cbcbc65e3e0dd1e80227a76d620ffc6684bbd61355bbedfdd6afc87c","observation_id":"49278843-dc57-447c-b1d9-14c11ea65aaf","resolution":{"observed_at":"2026-08-15T20:40:51.022359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.774477Z","title":null,"venue":null,"work_id":"2a49e0cf-b229-4701-9753-6a408d4f5f43","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.026456Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b08a5d40ac9c75b16346f9f1ca00aa495da2b8a30e8837da4d943f929387e375","observation_id":"99f2fd35-6031-488c-b7f2-e0848ffc7eb8","resolution":{"observed_at":"2026-08-15T20:40:51.782314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.029963Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.029963Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:3eafcec4b5b390a1210a9260bbd71eb91146babc6ec3b3c6582408c24f202755","observation_id":"fdea8842-4847-4848-91b0-f0a4ad7b24d0","resolution":{"observed_at":"2026-08-15T20:40:51.029963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.750796Z","title":null,"venue":null,"work_id":"4a62562d-4bac-459f-99fa-2c00523b940b","year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.033632Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b462d542a899893c7dc70e2123e5ec7b1afc8877fdef9ddd3020862601aa0b43","observation_id":"8228630f-c1b9-4908-956a-89e889d6f0b3","resolution":{"observed_at":"2026-08-15T20:40:51.755221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.037648Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.037648Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0015f06465e4b5c835b44ea02e7a30c1e994dba836ed81cda824c646cc5442a1","observation_id":"836d6584-7f24-43b1-8f1d-123a3089bf19","resolution":{"observed_at":"2026-08-15T20:40:51.037648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.728225Z","title":null,"venue":null,"work_id":"e496dc5e-a66f-4a10-9bd2-450ef9c18f47","year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.041091Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:5a55f47bbea8627bdc384d2e376916db9109b2ec7659bc73979adf64fd4e8b8d","observation_id":"2d82d505-afad-4a68-8a06-0e1a47508402","resolution":{"observed_at":"2026-08-15T20:40:51.734070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.707000Z","title":null,"venue":null,"work_id":"4cef8a23-84a6-4b60-a37c-e1c4486fb3b1","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.044923Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:d774892356a4a2e42a91835976497b760bf4a2d71246122170389014d8de6ee2","observation_id":"e944a157-1092-4098-a144-fa2293b4a557","resolution":{"observed_at":"2026-08-15T20:40:51.713537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.687801Z","title":null,"venue":null,"work_id":"bd9e563f-0ffb-4c95-a5ea-ffc811210868","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.048927Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:861a3347d527a4e49e9419a82880b9eaa5306f22ee742f3b1119927b3b6a3d89","observation_id":"a2e21f24-4ebe-4d3d-aea4-1331488718ff","resolution":{"observed_at":"2026-08-15T20:40:51.692838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T20:40:51.052531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.052531Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b884051108631fecad236d59cba4f41124c485267ddb0f6cdb279ed39babd3b7","observation_id":"4f1a5d66-53c4-4c68-9a19-fcee577037de","resolution":{"observed_at":"2026-08-15T20:40:51.052531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-15T20:40:51.057004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.057004Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:156c223dc28067f0d48c7dcf641d490aefbadd0ab2fb99829d1ef5d7aba1b95e","observation_id":"113a36c2-1c1d-4bd1-90a2-8ee91dc66bb3","resolution":{"observed_at":"2026-08-15T20:40:51.057004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.668827Z","title":null,"venue":null,"work_id":"103fca1e-bf86-49a4-8c24-c4734b52b69c","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.062418Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:24e735f4e85b7f35575dbb1d8790c6e83e2713f38474b7a30db45f3cf3e51d01","observation_id":"1520b3a5-d711-4471-96b0-0b2f6239d878","resolution":{"observed_at":"2026-08-15T20:40:51.676137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-15T20:40:51.068237Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.068237Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:d1e5950d08e0e6772dc11e786e9b24bdc8aea4e09908b88bd643ae93663d93b7","observation_id":"a8cf8d9a-a90e-4cf7-b737-4486a5049f24","resolution":{"observed_at":"2026-08-15T20:40:51.068237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.651277Z","title":null,"venue":null,"work_id":"65791221-e444-4e9b-a802-a2747cac3e37","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.075518Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b0b76ec6c54ad2a39cc1a9f1656cf5d3b519b786af09277788060b517acc0051","observation_id":"0defa92a-6493-4a6c-9bc4-906b1bef0385","resolution":{"observed_at":"2026-08-15T20:40:51.658062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T20:40:51.081237Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.081237Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2462651834a56cdb3eaab7bac8e9143c4c99c7e042842b1bdb1e454cc804115c","observation_id":"aaa0e2fa-95a2-4fb0-ab33-4a89672a7043","resolution":{"observed_at":"2026-08-15T20:40:51.081237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.634186Z","title":null,"venue":null,"work_id":"e473a919-7a82-49b7-849a-fb11ff391aec","year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.086789Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:a42d577bdd34499227f0f30cf17de983291ce75ca9f4a9366670362d245d5cf5","observation_id":"1affbfcb-9d5c-4c60-9272-42318ed6cca8","resolution":{"observed_at":"2026-08-15T20:40:51.640471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.613344Z","title":null,"venue":null,"work_id":"ee3a91f0-728e-4ce8-84e6-a881b69273c4","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.092593Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:e9cae827fafb5f9f4f8fcd8e426fc97f71fdcf7d7f8d6eeb14230708cfe38556","observation_id":"9f7743f8-2322-41ee-8229-9f1467dd42ad","resolution":{"observed_at":"2026-08-15T20:40:51.619564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2505.12435."}