{"as_of":"2026-08-15T18:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:204a5576f5a5b70ed76dd76c849d802602d3852b8fc9f5e952c624a353cb97ae","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:05:32.728004Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11098/citation-record","integrity":"/paper/2506.11098/integrity","json":"/paper/2506.11098/citation-record.json","paper":"/paper/2506.11098"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.520994Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.520994Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:6e8571bf61b99faefb6aa9c9dfa77158a72003e96e314ee04fd019b117c7b2ab","observation_id":"97cd3f7b-566b-455b-9cdd-a3f0b49084f3","resolution":{"observed_at":"2026-08-07T06:05:32.520994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.526128Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.526128Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:dc66b8c3ef34eb941bf3c642afcbfe5eb53b12662c815d9801d904652d3bf4df","observation_id":"c393ac49-6827-468f-9471-6b4e1b397011","resolution":{"observed_at":"2026-08-07T06:05:32.526128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.531806Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.531806Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:ab57493e7d8d09c9cc493de1dcdf919dc1aac1db27b8b8e1a0209bc90b489e66","observation_id":"b14c64b4-b5fe-4978-a3d5-703f650aecdc","resolution":{"observed_at":"2026-08-07T06:05:32.531806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.528426Z","title":null,"venue":null,"work_id":"187882fb-a838-4e7c-96f4-2034cc53620f","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.536525Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:aeb165b7a2063f996fcf348750e426c64115bd5ba2c2a4eee76621f15fba53d5","observation_id":"a67aad3a-e58a-4e61-a615-7a741689fdc0","resolution":{"observed_at":"2026-08-07T06:05:33.532490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.514044Z","title":null,"venue":null,"work_id":"11cf3ad8-5095-4b2a-a6f6-a69ec9505461","year":2020},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.540968Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:bd7e35931be48e95068aafc99a8c9959dc1d142b99ca82f1d38702c83b038954","observation_id":"2acc3515-d81f-4cc2-8512-0b46352bdb5c","resolution":{"observed_at":"2026-08-07T06:05:33.518687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-08-10T12:03:10.373653Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T06:05:32.545630Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.545630Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:5a6bbcd61766868014605e558018d2ff6fb53b0d59a5054d435ff7605ad7efcb","observation_id":"44a430db-54fa-440b-b31f-c752a6d5620a","resolution":{"observed_at":"2026-08-07T06:05:32.545630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.498732Z","title":null,"venue":null,"work_id":"65bdff01-b127-4e87-bc08-87fd2f550de6","year":2009},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.550254Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:5a4c0eff5c99860e93f3569d0828b7b9ca734e93727fc86e7c0f6dee3c47eac3","observation_id":"54f27b40-29ad-4e25-8375-2ab3cc997f5a","resolution":{"observed_at":"2026-08-07T06:05:33.504015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.554671Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.554671Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:16a6aeb503bba83140c459a7229a0a1ba6e8cd98f23854cf681856f63ea28085","observation_id":"4638ed7e-9013-4d13-a010-f0d005282a97","resolution":{"observed_at":"2026-08-07T06:05:32.554671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.475274Z","title":null,"venue":null,"work_id":"5284bd4e-7966-4790-a274-8c7202ce26eb","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.558585Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:fc73a8974883e07e0086f46be773f192760c021549386a9a662b6d7f14737e00","observation_id":"1fa1e298-330f-4b76-91a0-94a7d1af9242","resolution":{"observed_at":"2026-08-07T06:05:33.479058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.461794Z","title":null,"venue":null,"work_id":"53961a09-b0e8-40ce-9702-268baf9c6732","year":2017},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.563093Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:49b1f1d03e9100f453a6205b4f7fdbd73f1045fc1f42763e0bafc7df46e003b9","observation_id":"39cd5008-b9f1-45cb-b3e0-b8c2368a4106","resolution":{"observed_at":"2026-08-07T06:05:33.466212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T06:05:32.567554Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.567554Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:2f133d0b0b619ba7f645924bc9b056bcc6ef8894b89c6817d79b74f78958fa39","observation_id":"15bfb751-8677-430a-ba9e-c97906086dd8","resolution":{"observed_at":"2026-08-07T06:05:32.567554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.448454Z","title":null,"venue":null,"work_id":"6a8d3a94-34bd-44a4-a521-fb92f07d2e39","year":2013},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.572066Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:f2e3abac98a93b0cf4524ccf47d2aa53728ca29178e420cf00a07ba96d3a37b4","observation_id":"37b32f76-af8f-48b6-844a-3ffdeb628b8b","resolution":{"observed_at":"2026-08-07T06:05:33.452443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-14T22:24:15.551461Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-07T06:05:32.576314Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.576314Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:100b7538cee13de6521da5035b947ddcce84755d733b79abddc4645826f0675f","observation_id":"14915f7f-eb95-403e-91cc-6af505725a08","resolution":{"observed_at":"2026-08-07T06:05:32.576314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-15T18:13:42.319653Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-07T06:05:32.580792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.580792Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:27f57909664808ae0a26449ba0b7e6401c2bba15d0fcf915d3322ef460413e63","observation_id":"bbe05557-40df-4a4b-a544-a963a7750947","resolution":{"observed_at":"2026-08-07T06:05:32.580792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T06:05:32.585102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.585102Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:ada181d970c0bed99b39c7d27820badc0b5e0273b6a27dd2131230f7ba342d70","observation_id":"67bf7084-0174-4fcb-99f5-a281574c56aa","resolution":{"observed_at":"2026-08-07T06:05:32.585102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T06:05:32.589245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.589245Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:db2cdc44243fa0861c65b6e24e74d54befdbf89d5052c3b579801136685b2362","observation_id":"0209bffc-0395-4431-9978-bde3421de69e","resolution":{"observed_at":"2026-08-07T06:05:32.589245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.434674Z","title":null,"venue":null,"work_id":"3aecabee-6eba-40cc-b000-f4b412a71905","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.593625Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:eeb8df200e090802de6a0c2f49e140116f9396bb939d8852ebe0a5220ebef4a8","observation_id":"ec8188f9-2433-4f22-a2bf-cdf944df81a2","resolution":{"observed_at":"2026-08-07T06:05:33.438711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.421382Z","title":null,"venue":null,"work_id":"78bb53b3-6fc6-493f-abcb-f415f3c2851d","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.598590Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:1074af09d8b17b764c1628569b7e4b1eb852e4c438dd9c3e4d1a790c0934d256","observation_id":"4a59ccb9-e276-465a-8636-d63bbbbe37c0","resolution":{"observed_at":"2026-08-07T06:05:33.425259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T06:05:32.603244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.603244Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:262ac6cbfe84a862f4c07724973866f83e4ac0f62890cb15fe2db9fa77524616","observation_id":"af5dfd71-9369-4733-ac9b-992386de1f21","resolution":{"observed_at":"2026-08-07T06:05:32.603244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.408290Z","title":null,"venue":null,"work_id":"9ba6cf12-b0fd-480b-a7b6-6f77f06e63b7","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.607485Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:8fe81371cd5ae2e25d722d3e1386ff614fca53f591a99d30b6cb001d4a627366","observation_id":"df7810e6-6911-4b53-9744-df9bc024dc31","resolution":{"observed_at":"2026-08-07T06:05:33.412157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.395268Z","title":null,"venue":null,"work_id":"14781b01-f3a7-4e87-afcc-b0fee785ead1","year":2025},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.611469Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:c68dbc4a3679530ae87dd891ebbdced4368a2f737814176af37f98b06567ceb8","observation_id":"231ed846-a0a5-4267-8112-b3975ad68ce0","resolution":{"observed_at":"2026-08-07T06:05:33.399238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.381692Z","title":null,"venue":null,"work_id":"0765916a-a3d7-4f64-84a4-9a0b1bcfdd09","year":2020},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.615612Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:31ba9034a4bb3e1e8a4d11d50c28b8d9fab58e828edb641e8e3d84b944bdb989","observation_id":"b44231d1-45fd-4c50-8cbb-88ba9410d503","resolution":{"observed_at":"2026-08-07T06:05:33.385631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.368138Z","title":null,"venue":null,"work_id":"31fd3f9b-9d9c-4a8e-ae24-79e6b288cb6f","year":2015},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.619403Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:193a5d9dee95fe4b1220eb825f244924d60371b11ed0aa8e755cd98fd08729e6","observation_id":"2c603c55-2ae5-4eba-ab22-10ea4b4bced8","resolution":{"observed_at":"2026-08-07T06:05:33.372321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.353968Z","title":null,"venue":null,"work_id":"d05a8173-d5f1-4086-af88-51ec9fc5a236","year":2022},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.623578Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:de7514b2de9e36299cdd20c39074b7191cfced98dec68dbe179b712d12fbadbb","observation_id":"3955dbab-d44d-4b18-82f6-e7a3f4bea961","resolution":{"observed_at":"2026-08-07T06:05:33.358683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.340008Z","title":null,"venue":null,"work_id":"ad725b98-890d-457b-a56b-87ec2433e217","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.627509Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:9d5e9a090cb0e915bcb53558632ea802a8454a029fb8ef6bd4b7a944dcd86f75","observation_id":"94169d60-021c-4f72-8000-9e67f334bd5d","resolution":{"observed_at":"2026-08-07T06:05:33.343913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11296","last_updated":"2024-02-17T14:34:31Z","snapshot_observed_at":"2026-08-13T04:17:01.532546Z","submitted_at":"2024-02-17T14:34:31Z","title":"Dissecting Human and LLM Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11296","snapshot_observed_at":"2026-08-07T06:05:32.631391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.631391Z"},"links":{"cited_paper":"/paper/2402.11296","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:cb86263f34d6b822eaf1aa808f14ae1824d6cba9e7fd058be2c10bd157e0d00f","observation_id":"7c27b1ca-6f27-474e-8f27-021ee75597fa","resolution":{"observed_at":"2026-08-07T06:05:32.631391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T06:05:32.635828Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.635828Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:a06f94adaf584df548473b90e09cee3244aa954582abbfbce56f705cb845f1e6","observation_id":"4cd640aa-6fef-45cd-ab5a-98e22d37fa91","resolution":{"observed_at":"2026-08-07T06:05:32.635828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.326585Z","title":null,"venue":null,"work_id":"14c157d4-53b6-4a48-81b3-9dc5f6145913","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.639794Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:e7077306cce92e450d97595fc189def9c6a136e70db16d05ef910258a4e3e060","observation_id":"6c8ed455-6fc1-4c28-9a79-47d7443ba863","resolution":{"observed_at":"2026-08-07T06:05:33.330752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.06965","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.010192Z","title":null,"venue":null,"work_id":"340d45b2-e8b1-4239-afa7-02b08d7ed6d2","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.643899Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:754f5ac18206aa6ff3df8dfb67eec53a047907230895293b9329ab296e9a56c6","observation_id":"0050e4e5-2c19-42df-b80a-5aefc823c192","resolution":{"observed_at":"2026-08-07T06:05:33.018292Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T06:05:32.647804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.647804Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:dffc76c4fefef40357298ac9f0a76740017bb88a2a306d0e8ae94d6dd776830a","observation_id":"134dfb4e-b7b2-4554-a56a-0ec9ccb4fb01","resolution":{"observed_at":"2026-08-07T06:05:32.647804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.312922Z","title":null,"venue":null,"work_id":"9adcb359-816c-49de-a2e1-0e2c6f537999","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.651800Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:da58a39e35f8f835a1a759c2ef8e4c7cf7ee20891d53135ac748caf67406b076","observation_id":"0d800e66-12e2-4516-a0b7-70f26436693b","resolution":{"observed_at":"2026-08-07T06:05:33.316887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.299410Z","title":null,"venue":null,"work_id":"f696950b-8f97-423a-b418-78fb52b0fc02","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.656381Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:136a5559ed82ac545bb9a49855687c65db993bc3f4617bde7d9f51a4b76d38ab","observation_id":"c16bedea-7899-4537-b161-7e33e1cf8054","resolution":{"observed_at":"2026-08-07T06:05:33.303371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.284666Z","title":null,"venue":null,"work_id":"3456f2f1-7cef-4303-84c6-e5c65125bbde","year":2022},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.660320Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:56dd3d2281b730bf92c030e1b564d6146090116962d15d9d33843f7f8dce4cba","observation_id":"e3c64ba8-a585-434f-8d09-81744b4e0b12","resolution":{"observed_at":"2026-08-07T06:05:33.289403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.271285Z","title":null,"venue":null,"work_id":"b093a29a-674c-4c4e-b080-98537b869979","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.664289Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:37cf6ba4f87a2bdd2b69184e7e542c088c4c0267095a0e78ea49fda3d0311f59","observation_id":"7ccfae8f-eb6d-4547-99b4-4b9439e73479","resolution":{"observed_at":"2026-08-07T06:05:33.275333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.258096Z","title":null,"venue":null,"work_id":"e05b5300-f520-4960-be24-beafe33125a5","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.668431Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:0a548dbdf8e207574fd092e9462e186619e7206b766a0d4c5c461756ffd52e12","observation_id":"0449bcc5-cd22-43c8-8a98-5a9be9064e05","resolution":{"observed_at":"2026-08-07T06:05:33.262059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-14T12:56:25.698035Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T06:05:32.672178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.672178Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:24647f354609fdacd8a3b2783316dd4203a1a6f278241b8100e79e1a91bbbe91","observation_id":"0fc2bec0-5495-40c1-a5e9-18cfb280fb3c","resolution":{"observed_at":"2026-08-07T06:05:32.672178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-15T13:06:01.740558Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-07T06:05:32.676825Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.676825Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:0fcfed3622c3f91be24633840c84c79cd143408701bb657841f38ea673948b82","observation_id":"a3844b5c-fc83-4018-b6a9-5f94054c4f26","resolution":{"observed_at":"2026-08-07T06:05:32.676825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.243100Z","title":null,"venue":null,"work_id":"6bd2873d-31fb-4563-9fde-0b686f9e3dac","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.680958Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:25febdd759f0788f5380e20acf058a293a6b0601f9d67484ec896f9f1122792f","observation_id":"c1ca1cb8-b1c0-4130-afcc-3099e44ece02","resolution":{"observed_at":"2026-08-07T06:05:33.248054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.227919Z","title":null,"venue":null,"work_id":"4bc6d976-f2e8-44d5-84c1-eb676d896721","year":2020},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.685213Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:a6473063e2061933932630ba013e12678dc4ed236826f2a177460bfeb73f9483","observation_id":"0b4f36e2-831a-4a94-b610-5e9d3d917d0f","resolution":{"observed_at":"2026-08-07T06:05:33.232005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T06:05:32.689590Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.689590Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:d1e59db7cac18751416bd7bb69499ae92a9165c1221b87e493eb928a746726f0","observation_id":"362a54b7-755f-4ab6-b9d8-4a615b1153db","resolution":{"observed_at":"2026-08-07T06:05:32.689590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-08-15T09:26:05.847971Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-07T06:05:32.693883Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.693883Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:d5c4bbce6d84262bd3daa34da6bfca3483d360888ca7bb4f5417fa3367cd03fd","observation_id":"242ee8b0-5754-4c86-9e0e-6a9315e892ae","resolution":{"observed_at":"2026-08-07T06:05:32.693883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.213662Z","title":null,"venue":null,"work_id":"bb1b2626-9e07-4f8a-b551-0f27527a0777","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.698505Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:a9e157ba54634401a75e08d4f9d9577383833bd76ee4324f7c6ba20ea0f125fa","observation_id":"fdd9d55c-10bc-41fe-9be2-aeac5ce84b3b","resolution":{"observed_at":"2026-08-07T06:05:33.218139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.197959Z","title":null,"venue":null,"work_id":"9994357a-29f1-4db2-8cf6-549b01115d82","year":2022},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.703255Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:70833c3d21c5df78d0f2392d4e92651178aef6472ef79500c21e2334e1fe0193","observation_id":"9192bb21-5105-4608-9b76-1f00beb25dc1","resolution":{"observed_at":"2026-08-07T06:05:33.202246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-08-13T00:17:27.395385Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-07T06:05:32.707537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.707537Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:ee7b426f241baddd9702c88879579e926b71980d15dd093e04b2dadab763f596","observation_id":"0d0b9669-c8b2-4b83-8629-aa35d4e4397f","resolution":{"observed_at":"2026-08-07T06:05:32.707537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.184109Z","title":null,"venue":null,"work_id":"e59a4a3a-5368-4851-88ee-8a547fb0c976","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.711756Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:0779ee365535954adbb584fc6acb53461991c258b0ef2411d029172f1390b0a5","observation_id":"944ea925-9df0-422d-bede-ecfb6cef2c23","resolution":{"observed_at":"2026-08-07T06:05:33.188133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-14T14:26:41.039383Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T06:05:32.715738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.715738Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:bd70549b560393200dab1743cbe06e8ad0a38d84bfe4906c021eb1e62fec1ccc","observation_id":"8a00e02c-ef7c-4cd6-b98f-5b30ad389630","resolution":{"observed_at":"2026-08-07T06:05:32.715738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-14T18:51:06.334767Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T06:05:32.720004Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.720004Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:984fa324b4008973b791e82d91d626bddf4fa346bddade3f7352ac684d2f6a6a","observation_id":"9520ea74-8889-43c0-bd1b-372e99a61b44","resolution":{"observed_at":"2026-08-07T06:05:32.720004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.170054Z","title":null,"venue":null,"work_id":"fd624d99-38b7-4823-abb7-be3e4a913f63","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.724090Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:728e94b460d942aa40df68d4d2b16c1e65f1a527a9e2010ff97bd06d976655d5","observation_id":"0bea02bf-8970-4335-b3c0-29668a3e6023","resolution":{"observed_at":"2026-08-07T06:05:33.174460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-15T10:46:42.452851Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T06:05:32.728004Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.728004Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:f85f1321a6e68b5f512ec390e84f930f590253cba11343bddb5f416a6328ace4","observation_id":"385a7655-4429-4b52-86ac-4b787c317a94","resolution":{"observed_at":"2026-08-07T06:05:32.728004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T01:19:20.845098Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.11098."}