{"as_of":"2026-08-18T06:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4dd80f66de755166caa4c119f5129862455cde20de7919a9d763b720405574ae","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:52:27.322147Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.22851/citation-record","integrity":"/paper/2509.22851/integrity","json":"/paper/2509.22851/citation-record.json","paper":"/paper/2509.22851"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-08-16T14:18:02.753710Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-04T14:52:18.602366Z","title":"Amini, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.602366Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:0c7286713609842c6b222c022063932fdcf3552329cc8b1cf8b90f3eea888f8e","observation_id":"d26ae2f7-df07-4591-ab61-cb299ee78d85","resolution":{"observed_at":"2026-08-04T14:52:18.602366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-16T14:51:01.638500Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-04T14:52:18.668425Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.668425Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:50b51827b0580bf4580758fb81a77edf35f06b2ea6cdc3b868ca8ad79e8af618","observation_id":"4deb9cf5-bfb4-4a4e-a885-a13706c67041","resolution":{"observed_at":"2026-08-04T14:52:18.668425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:18.815293Z","title":"Bousquet, S","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.815293Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:d1a708f4cbb48f15afd7c5ce3f57511b99831e7469c9c3a2eea3638553829dcc","observation_id":"40e0d324-70e7-478c-8376-f3279d3e5fbb","resolution":{"observed_at":"2026-08-04T14:52:18.815293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:18.874694Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.874694Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:6e95f119568df346f1da6f6ae2664764a57be46b42d79f46db470d0b63a8ce30","observation_id":"931f9ebc-bfbc-4231-8f18-1f5a1edb4f66","resolution":{"observed_at":"2026-08-04T14:52:18.874694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:19.014491Z","title":"Burton, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.014491Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:13966bf8a731e6b07d98c3d7761a43f61b770d4e6ba6ed4d5516ef13c7701811","observation_id":"a0d963fd-66b3-4871-b322-c35f6d0c173c","resolution":{"observed_at":"2026-08-04T14:52:19.014491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-17T00:40:28.013808Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08266","snapshot_observed_at":"2026-08-04T14:52:19.102106Z","title":"Chittepu, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.102106Z"},"links":{"cited_paper":"/paper/2506.08266","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:5a279869e05f0f069a485be436edb83c8baf5155e971fabc4d4a15e10fb7ef3a","observation_id":"32637181-00ce-4796-a516-eaa778829233","resolution":{"observed_at":"2026-08-04T14:52:19.102106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:19.230754Z","title":"Cortes and V","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.230754Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:817dc2efb544390a46719b8ffc6f7d1858c14eb994452bd8cc49b937392cf8e5","observation_id":"b5410bf6-2633-4911-bb22-02f398f49f7f","resolution":{"observed_at":"2026-08-04T14:52:19.230754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-04T14:52:19.341056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.341056Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:1860a787fef53e80b6873453f3012fc33e450f888a1518dbfd0040594c380620","observation_id":"5b0d4bfe-b7ad-411a-ac61-fff73e42d8f6","resolution":{"observed_at":"2026-08-04T14:52:19.341056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-14T19:10:00.850271Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-04T14:52:19.488335Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.488335Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:22c45c33fa16dd6adb74dc3b103d1d737d4eecdcc76da0781d52c72a5ebf4855","observation_id":"3e996b52-e079-416a-b208-9bc0465b48fd","resolution":{"observed_at":"2026-08-04T14:52:19.488335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-04T14:52:19.641786Z","title":"Dubois, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.641786Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:dc2e40f8e406fa77efb7cdbb34315cc66f002c5d2b41f1c8a881615318579409","observation_id":"ffbc1c1f-7249-426c-9576-bb1c3d3078bc","resolution":{"observed_at":"2026-08-04T14:52:19.641786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:19.721322Z","title":"Freund, R","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.721322Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:3e4e36b2625cadc344aca4bb5dc707ae48b3b4a76bff84dc61eac998eb374251","observation_id":"c9f67d72-0320-4973-874b-7c2fa63207ed","resolution":{"observed_at":"2026-08-04T14:52:19.721322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:19.829631Z","title":"Grattafiori et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.829631Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:89b4ab3481f6202718f533d6d3bac204ca56b84dda861e30ff543ea928abf65b","observation_id":"bdc8121d-fda6-4bc6-b99a-12aa39ffd21d","resolution":{"observed_at":"2026-08-04T14:52:19.829631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06187","last_updated":"2021-07-13T15:37:20Z","snapshot_observed_at":"2026-08-16T18:10:19.681729Z","submitted_at":"2021-07-13T15:37:20Z","title":"Deep Ranking with Adaptive Margin Triplet Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06187","snapshot_observed_at":"2026-08-04T14:52:19.927431Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.927431Z"},"links":{"cited_paper":"/paper/2107.06187","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:b6a58f1a58f2497cb2fd47cd76e8647e45d87ae8cbd58e85d4f3c76e13a3aec6","observation_id":"2e7b1d4a-22e4-4918-a44a-4d50c35ee4ea","resolution":{"observed_at":"2026-08-04T14:52:19.927431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:20.063810Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.063810Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:c1c63045a96031d7568f74271a4ee047b3e95d95612393a69412baa95513e999","observation_id":"b135e933-e8ff-4e02-a62b-2745286621fe","resolution":{"observed_at":"2026-08-04T14:52:20.063810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1049/cp:19991223","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Herbrich and J","venue":null,"work_id":"ed75dc60-6a47-4c8c-be4e-86d4ce450461","year":1999},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.143671Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:92934c386b59ce0a68e6357f5a05859663ed1aa4ee124590a2fac991e9fb1c9b","observation_id":"07170c3e-662a-4c99-8ea6-9f5da5ce5873","resolution":{"observed_at":"2026-08-04T14:53:21.597770Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:20.216813Z","title":"Huang, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.216813Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:e9e214b502e1b6af22ac373bf50f1751ecf652e80d8d39dc7d8e219b6427798c","observation_id":"5cc9a423-2cf1-48c2-a280-0d7b0eabde7b","resolution":{"observed_at":"2026-08-04T14:52:20.216813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-08-14T02:56:45.044088Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-04T14:52:20.301947Z","title":"Jaques, A","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.301947Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:de9092cb28d2094b84d68b7b38172d853d3fcb6b0940918fb17b8f4d0ec15a37","observation_id":"bcb942e4-821c-45b6-b63f-d85de30a8e5b","resolution":{"observed_at":"2026-08-04T14:52:20.301947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01765","last_updated":"2017-12-05T17:13:48Z","snapshot_observed_at":"2026-08-14T20:06:40.829979Z","submitted_at":"2017-12-05T17:13:48Z","title":"Best-Worst Scaling More Reliable than Rating Scales: A Case Study on Sentiment Intensity Annotation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01765","snapshot_observed_at":"2026-08-04T14:52:20.420279Z","title":"Kiritchenko and S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.420279Z"},"links":{"cited_paper":"/paper/1712.01765","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:be88490dbff1189fdfb2dfaa83add1fac1120333cb3b8c08dedc689ded4db653","observation_id":"7fa6e70b-4141-4aea-b59c-03c5577fc3fa","resolution":{"observed_at":"2026-08-04T14:52:20.420279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-17T18:23:08.323051Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-04T14:52:20.583374Z","title":"Lambert, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.583374Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:50ad860b5e7e52e5c0fe6d0415bfda2f43cddafa5aecc1a3237bc60aeb6cd9bf","observation_id":"1e925bf3-af47-4214-bfe5-5b02f232054a","resolution":{"observed_at":"2026-08-04T14:52:20.583374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:20.699279Z","title":"Ledoux and M","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.699279Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:7bc3a542b2cff043e0ea9f385de5a987fddbd961c04fa2803f7906f3d655d01d","observation_id":"aa2d5130-5b08-4c55-bbb2-df410334c849","resolution":{"observed_at":"2026-08-04T14:52:20.699279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:20.899020Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.899020Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:7c76aafd4ead60ff27a3c3226b9293ee3446773344dc479b0ad55ad81a173477","observation_id":"c0f3625f-7d29-4853-98e3-d2093ffff08a","resolution":{"observed_at":"2026-08-04T14:52:20.899020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:21.057847Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.057847Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:593dd7e13fdd9f519d2cae0fd44e27b148ed23fa5780a1789846135a2f2a59d2","observation_id":"ab919cad-b1d9-4238-8dfc-285aae93f89d","resolution":{"observed_at":"2026-08-04T14:52:21.057847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:21.262596Z","title":"Peters and S","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.262596Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:6ef6007e917cd37ea3fc4f352549fb0f7a6a7f80963ddedb725401a0e8b085af","observation_id":"fa7afd46-3c23-46f2-9c88-84e69c0d9b98","resolution":{"observed_at":"2026-08-04T14:52:21.262596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04932","last_updated":"2024-04-07T12:10:04Z","snapshot_observed_at":"2026-08-17T14:13:57.542823Z","submitted_at":"2024-04-07T12:10:04Z","title":"Towards Understanding the Influence of Reward Margin on Preference Model Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04932","snapshot_observed_at":"2026-08-04T14:52:21.427999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.427999Z"},"links":{"cited_paper":"/paper/2404.04932","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:390e90436a7d2de8c694a3b77fb0597b5f41bcd39949d4a1010875373cb3e15f","observation_id":"fdbcda8b-ed8c-43ae-9c2f-8b4c3593c9c2","resolution":{"observed_at":"2026-08-04T14:52:21.427999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-16T14:02:09.339561Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-04T14:52:21.625861Z","title":"Rafailov, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.625861Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:6f4efa2d5a98f71ce4aba22f295f6a47ef505061c7d17134155b0cf845c15ff3","observation_id":"3b0f04f9-5a26-44f5-aa62-e5839e6ae26b","resolution":{"observed_at":"2026-08-04T14:52:21.625861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-04T14:52:21.762269Z","title":"Rafailov, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.762269Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:6180ad3b0b7fadf34913c355d50f5edccf58ca2044ea1e75d525010790bd22b1","observation_id":"3d63d4ca-da49-4ff5-b230-8f1f9c880fcc","resolution":{"observed_at":"2026-08-04T14:52:21.762269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:21.915511Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.915511Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:6ad705fe592d97d1c8f171628562407b3e3d84a108f5b7588748dced0aad22a7","observation_id":"7e076658-0a5c-4316-a66f-74e70d1cae92","resolution":{"observed_at":"2026-08-04T14:52:21.915511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:22.048055Z","title":"Shalev-Shwartz and S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.048055Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:9617f66ce25c61d5ebc145286be3124d11ed77d145f175ec707c8b11ce421fd2","observation_id":"03cac645-6536-4014-9036-d4ab7967df3a","resolution":{"observed_at":"2026-08-04T14:52:22.048055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-17T15:45:31.564132Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-04T14:52:22.241257Z","title":"Stiennon, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.241257Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:27abd72d1f86342f03a4a3716e9f0233c51203d95bc5ce35756f7ee165efc5fa","observation_id":"b2c2bc61-a198-446a-9200-9fa6941cfa6a","resolution":{"observed_at":"2026-08-04T14:52:22.241257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:22.403138Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.403138Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:13a5db5aaf60573189c7bf05539650e7cc823e6376b0f102ff0e799237d80f91","observation_id":"35854391-623f-4756-b624-e2e1b12ea2ed","resolution":{"observed_at":"2026-08-04T14:52:22.403138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T14:52:22.474124Z","title":"Touvron, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.474124Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:d7aacc0373a53c612cd26438a35c319111fe0c3a3a19e07e236c722c3e0a41e3","observation_id":"62422090-11c8-440a-9b8b-5b9b17d101ae","resolution":{"observed_at":"2026-08-04T14:52:22.474124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14770","last_updated":"2025-06-19T20:59:14Z","snapshot_observed_at":"2026-08-16T15:30:20.341021Z","submitted_at":"2023-05-24T06:19:14Z","title":"Using Natural Language Explanations to Rescale Human Judgments","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14770","snapshot_observed_at":"2026-08-04T14:52:22.663086Z","title":"Wadhwa, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.663086Z"},"links":{"cited_paper":"/paper/2305.14770","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:d694ca058725e68f1570b4e3daf08114ba73ca06acbf48a22825d638e862de79","observation_id":"ad48c468-41f6-4d02-b234-1c325540d4b9","resolution":{"observed_at":"2026-08-04T14:52:22.663086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-16T14:28:08.540549Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-04T14:52:22.806003Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.806003Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:2f24f7cb49e72560f80d0476e1ccd306c18bf7bb60a1060b931ca9c2a2f1b1d4","observation_id":"6e2155e5-e488-4033-a71f-79949deb1a4c","resolution":{"observed_at":"2026-08-04T14:52:22.806003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09385","last_updated":"2024-10-30T04:47:00Z","snapshot_observed_at":"2026-08-16T13:25:45.978078Z","submitted_at":"2024-08-18T07:04:16Z","title":"Reward Difference Optimization For Sample Reweighting In Offline RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09385","snapshot_observed_at":"2026-08-04T14:52:22.977912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.977912Z"},"links":{"cited_paper":"/paper/2408.09385","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:5d87c1195457188c123a1ec234c643914ae906e52455076db2d8ebc9a4c33f8a","observation_id":"930e524d-670e-4629-90cb-11db64921b0a","resolution":{"observed_at":"2026-08-04T14:52:22.977912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:23.152384Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.152384Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:cc7d3fce3f453d305ca1fea42ce96396d733ca4586cb2a086459ac62c7aa97be","observation_id":"a8ebfb0e-6e6d-484e-99f7-8832427597a9","resolution":{"observed_at":"2026-08-04T14:52:23.152384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-08-18T05:01:06.444745Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-04T14:52:23.416543Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.416543Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:6f9fe1daa0fbd41ed85e48be8f6e78375202ea9453ca1ff2f00d18b3d714cc3f","observation_id":"b4039719-d289-4f68-abe4-e1b8e027db86","resolution":{"observed_at":"2026-08-04T14:52:23.416543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10148","last_updated":"2025-07-19T03:40:37Z","snapshot_observed_at":"2026-08-16T13:09:46.339914Z","submitted_at":"2024-10-14T04:29:57Z","title":"AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10148","snapshot_observed_at":"2026-08-04T14:52:23.506011Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.506011Z"},"links":{"cited_paper":"/paper/2410.10148","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:f13b96a07eb361b94b76b02690366dbd9f4860170306a87987c2ddd21846b375","observation_id":"9402494a-17ff-40a8-a70f-fee6e656ded9","resolution":{"observed_at":"2026-08-04T14:52:23.506011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08639","last_updated":"2024-10-13T08:53:00Z","snapshot_observed_at":"2026-08-16T13:35:01.263462Z","submitted_at":"2024-07-11T16:21:18Z","title":"$\\beta$-DPO: Direct Preference Optimization with Dynamic $\\beta$","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08639","snapshot_observed_at":"2026-08-04T14:52:23.688099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.688099Z"},"links":{"cited_paper":"/paper/2407.08639","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:80d0ae8475631956a56f4f52b1a1a9c7e67aeae7125dab46d7c1857a0e8cc92a","observation_id":"34d1da5e-9660-4de1-8f71-242207ba596a","resolution":{"observed_at":"2026-08-04T14:52:23.688099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:23.753724Z","title":"Zhang, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.753724Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:4b8ec509c6d5927ebb182a135f8e9492fdf0b2fa78e035d31f6980820dc8d36d","observation_id":"a7872236-7bbf-40f2-a2a6-75a9f0eeba6e","resolution":{"observed_at":"2026-08-04T14:52:23.753724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-16T15:32:15.390851Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-04T14:52:23.843777Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.843777Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:fd18d6659791b227a1de065452a2d1672b45a9ec9655b0d9baac6b84ef69ba17","observation_id":"dca28929-3147-44b8-80dc-00812939bbea","resolution":{"observed_at":"2026-08-04T14:52:23.843777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:23.913195Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.913195Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:29207c128913e94365da25fe08e559d918d6a401713decd1768dd304d7f33cc7","observation_id":"4195abd2-6dd2-466c-9378-df0b02df4e4e","resolution":{"observed_at":"2026-08-04T14:52:23.913195Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.005140Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.005140Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:df3c91d74016090553376dda0f07db0e2107a5190c2cafddd0d97c2db60d2704","observation_id":"33823365-27bd-4322-a321-50012d02e943","resolution":{"observed_at":"2026-08-04T14:52:24.005140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.136944Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.136944Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:4a8281dffff6d1652b7073df719835b5e6af2cab14e44ff2d2956eec2ea89083","observation_id":"ba6ec33e-dac8-4464-aa14-a986278fc4ac","resolution":{"observed_at":"2026-08-04T14:52:24.136944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.264276Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.264276Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:c35837006cc500a302981f375bf2d2b211e0418becf81d15dc06b551e1c6eea6","observation_id":"ae76b861-3e3a-4385-bd13-6c4d87631726","resolution":{"observed_at":"2026-08-04T14:52:24.264276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.415800Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.415800Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:4fc38b905286998855e914101a5644e14525461c8b902940680ed6e7fe8a7dff","observation_id":"b183f1b7-2860-4c41-9765-ed3591a2c7a1","resolution":{"observed_at":"2026-08-04T14:52:24.415800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.575574Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.575574Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:08a3e3c87bd6ad17d6faf87fe3cb2c542a482343d4c362e137ee71eff14a6110","observation_id":"becc15a5-a966-456d-8d73-6f5e5ae7094f","resolution":{"observed_at":"2026-08-04T14:52:24.575574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.676764Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.676764Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:13de49e9ce3fdc13239cb7cb95e4fb9a2229c4a1ec09e462189b405403baa6ce","observation_id":"18a40dff-31c5-4a95-99fd-589c4fa50ef3","resolution":{"observed_at":"2026-08-04T14:52:24.676764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.819696Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.819696Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:9d2814bcdbcde084a12bb08b461d1941d422f405ddba9a0f6717165fb888ca8f","observation_id":"df5b5ed2-91a0-4b42-8d8f-32f52c2bc217","resolution":{"observed_at":"2026-08-04T14:52:24.819696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.935392Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.935392Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:3ce71adef9aad5c454d7b43beb4c74c1ae2e7a6fdc509b6da40447ea9055b136","observation_id":"46703fff-72b9-4720-a0e6-e0bbc6f9801b","resolution":{"observed_at":"2026-08-04T14:52:24.935392Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.028667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.028667Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:c54f4b29fe41d7f056d1830277d285c3f33db32527e832a40b33d01c898667dd","observation_id":"19396117-59ba-4b42-89df-68333583a515","resolution":{"observed_at":"2026-08-04T14:52:25.028667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.184988Z","title":"Trailer Park","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.184988Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:c235f0746be9b872af03450134164cb31e4399105dc82f9e76d5f035da6aa3c0","observation_id":"6c25a5f6-86cc-4ca9-958b-055af1d78953","resolution":{"observed_at":"2026-08-04T14:52:25.184988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.276801Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.276801Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:aab16dedffcd54d220314a7cd02a253b0d0d904ec366fd083fba4cc6a64b723a","observation_id":"0eacef87-9bdd-47b8-be7e-b47458e2265c","resolution":{"observed_at":"2026-08-04T14:52:25.276801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.390652Z","title":"It comes in various toppings including classic pepperoni but also more unique options such as cathead (a combination of prosciutto and arugula)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.390652Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:8d332e3847c55582eb5a7ecff5359ab98b5242f2753716a682ce9f81620e0ed1","observation_id":"4f33b784-df1c-4897-9197-736c156c6e89","resolution":{"observed_at":"2026-08-04T14:52:25.390652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.463887Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.463887Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:23fd68a8934aa70cb08281cd476418aae238d43d519dbfeed081a6e02fdc6bff","observation_id":"7d7a2a36-3ae1-4e81-a092-4ef92aa583cb","resolution":{"observed_at":"2026-08-04T14:52:25.463887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.585139Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.585139Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:663963e78003fa0dccfef5bf0cf7828bee124de0b659a81dc78b51f1cfcb55ea","observation_id":"f0047949-78bb-42c4-bc94-29c180a70d5a","resolution":{"observed_at":"2026-08-04T14:52:25.585139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.732076Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.732076Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:416aab0788e31cb275be9e47b592c9b715d512a322aff138868f319897ad759f","observation_id":"dd6a007a-d963-4e73-a11e-2c5528730d26","resolution":{"observed_at":"2026-08-04T14:52:25.732076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.833263Z","title":"These are just a taste of what Austin has to offer when it comes to street food culture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.833263Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:42650c38123ba36f5335a884f674c0eddda16311f0cde650871c5474e66379c6","observation_id":"bd327419-9064-4441-8af6-cc07ab337fd8","resolution":{"observed_at":"2026-08-04T14:52:25.833263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.929612Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.929612Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:e249980f512de2952e1b4d4ee650f68e88c5ab3c891a44bc2f8b193cf10978a0","observation_id":"43a863ae-88c2-437f-a5b5-9639a4e27c6a","resolution":{"observed_at":"2026-08-04T14:52:25.929612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.034237Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.034237Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:91bfb84d336bd79e37919d2023543ed67a19fb3132a8a4ea09cedf57fc4bab46","observation_id":"1b523c27-65b4-49c9-aa95-71dd2e7c5d37","resolution":{"observed_at":"2026-08-04T14:52:26.034237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.120585Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.120585Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:c85fef54c676f160fc52643f80001286c819d866734976ce02db828703095829","observation_id":"80c953cb-459c-4c94-bb2d-d88893718526","resolution":{"observed_at":"2026-08-04T14:52:26.120585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.249371Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.249371Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:e80bb4bd21e1e754e91e29d30ac510ad52451ce08fd106577afa83a5eeb39ceb","observation_id":"80241729-884a-4899-a568-d88f50667a00","resolution":{"observed_at":"2026-08-04T14:52:26.249371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.362875Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.362875Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:b26f7f641b11e96e783cfb8ce864c10ae3476ce1f07bb70b866d7e57dda7794f","observation_id":"42c6f05d-10b4-494e-83b3-bee6ed28f842","resolution":{"observed_at":"2026-08-04T14:52:26.362875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.511683Z","title":"Big As Yo´Face","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.511683Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:3e9482cffa009db2b02ae5fa78590ce84ebaa8df91b6940c4fca0d8ce8c08990","observation_id":"28510f25-63f7-410c-94b6-ecd3adb4bb55","resolution":{"observed_at":"2026-08-04T14:52:26.511683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.714613Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.714613Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:71a78409ce11b4db7c602712d547c81108ab6bad3d546b1cb44220e63216f389","observation_id":"62559684-b2ae-41ab-aea6-8b968a5a706c","resolution":{"observed_at":"2026-08-04T14:52:26.714613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.922954Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.922954Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:8f63dd67f5ab419e09c8d8ba8ca1c62a22822c96a8fa4e5deb4782e7b1877e86","observation_id":"600040fb-d03d-4019-8689-363ce8530dba","resolution":{"observed_at":"2026-08-04T14:52:26.922954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:27.059039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:27.059039Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:55fed96d5e6c235a3381d31689c4cb7d44baaacaf926f057708f3459854ef87d","observation_id":"cb8e8394-cc1c-4420-8ac0-4f9e068db294","resolution":{"observed_at":"2026-08-04T14:52:27.059039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:27.204351Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:27.204351Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:cd0aa7a718811a3017d7a195d98359cfc564fc0b44ab40b1de8d480481e86fc4","observation_id":"a5b037e6-d769-4eca-9431-eee23b86fe8c","resolution":{"observed_at":"2026-08-04T14:52:27.204351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:27.322147Z","title":"Lion Burgers,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:27.322147Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:f494cb42447fbe3eb87c450988accd428eab8db6c16ea4b0dffb210c4b98e0fb","observation_id":"7fb140ae-8efa-435e-8c29-f93029f42f82","resolution":{"observed_at":"2026-08-04T14:52:27.322147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09528","last_updated":"2023-11-16T03:13:29Z","snapshot_observed_at":"2026-08-16T14:42:50.641609Z","submitted_at":"2023-11-16T03:13:29Z","title":"HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09528","snapshot_observed_at":"2026-08-04T14:52:23.326087Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.326087Z"},"links":{"cited_paper":"/paper/2311.09528","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:0f647eb5c2f52bd49759a5b4b0fa0327d506391c0d4d812fe213b804b9f2f3eb","observation_id":"cc987b26-76a4-4d61-82ee-429d539bd995","resolution":{"observed_at":"2026-08-04T14:52:23.326087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2509.22851."}