{"as_of":"2026-08-18T03:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8521cfa098305bcff6e87e2e60645c4666b9c03f1e697600f9b4844457b7c8c9","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:18:40.431498Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01706/citation-record","integrity":"/paper/2505.01706/integrity","json":"/paper/2505.01706/citation-record.json","paper":"/paper/2505.01706"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.11602","last_updated":"2022-11-21T16:00:31Z","snapshot_observed_at":"2026-08-16T17:36:31.228792Z","submitted_at":"2022-11-21T16:00:31Z","title":"Improving Multimodal Interactive Agents with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11602","snapshot_observed_at":"2026-08-16T04:18:39.907673Z","title":"Improving multi- 9 modal interactive agents with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:39.907673Z"},"links":{"cited_paper":"/paper/2211.11602","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:8f09a5975f6803979d5b83feef036325ac0a2bbbba2de2654432e2600976ae1d","observation_id":"da9d4998-f419-4811-846d-12cbe65310da","resolution":{"observed_at":"2026-08-16T04:18:39.907673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T04:18:39.947889Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:39.947889Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:84b80a461fb3b5be4b845704496f3677f82e8689bc343c6deee5a362d30cc729","observation_id":"17a81456-0a56-4f8f-8587-92106ba508e9","resolution":{"observed_at":"2026-08-16T04:18:39.947889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:39.952368Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:39.952368Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:7ecf96bdc87eaeabdd0cbc8b2234e44e59beeed7a32255dbab84b0985dd1c50d","observation_id":"5b48d90a-eaa2-442c-beb9-bcc31db1c918","resolution":{"observed_at":"2026-08-16T04:18:39.952368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-17T11:20:55.974248Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-16T04:18:39.956959Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:39.956959Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:0a7f95b3f626835e1f39a12b547826a0abd4b3424b3de1ca3b07e160bb56f101","observation_id":"213a1309-5cca-4770-b8a1-14dfdeba5ee6","resolution":{"observed_at":"2026-08-16T04:18:39.956959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00409","last_updated":"2024-04-12T01:09:37Z","snapshot_observed_at":"2026-08-16T15:35:06.002888Z","submitted_at":"2024-03-01T09:55:18Z","title":"Provably Robust DPO: Aligning Language Models with Noisy Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00409","snapshot_observed_at":"2026-08-16T04:18:40.034871Z","title":"Provably robust dpo: Aligning language models with noisy feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.034871Z"},"links":{"cited_paper":"/paper/2403.00409","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:8b00d2ab4e7d40871448dbf3599fe8aaf0c95710e28d87242b2b0a94d001d913","observation_id":"b9675d9a-123f-4c1c-b829-6b7d8892609d","resolution":{"observed_at":"2026-08-16T04:18:40.034871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.092021Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.092021Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:715d745d5a82d2e38da7c9793b17e336dcdc29b07ff70e20191ff5b239dd71ed","observation_id":"4b214a57-c63a-44cc-a86f-fc50abdf03cc","resolution":{"observed_at":"2026-08-16T04:18:40.092021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18101","last_updated":"2025-05-22T17:50:19Z","snapshot_observed_at":"2026-08-18T01:46:20.305603Z","submitted_at":"2025-01-30T02:47:41Z","title":"Diverse Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18101","snapshot_observed_at":"2026-08-16T04:18:40.097323Z","title":"Diverse preference optimization.arXiv preprint arXiv:2501.18101, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.097323Z"},"links":{"cited_paper":"/paper/2501.18101","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:98b888b9e94d93c86fb00ed40f46e4afad5c9eebf90f56a7d6f2ac79680a52ce","observation_id":"99edc449-12fa-4e1d-9084-e2a3c0e2577d","resolution":{"observed_at":"2026-08-16T04:18:40.097323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.791000Z","title":"2D-DPO: Scaling direct preference optimization with 2-dimensional supervision","venue":null,"work_id":"a53a4d6a-ceb7-40df-ac98-5e77cd1ddbe2","year":2025},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.132613Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:70a305bea3fe20907d50476ce47183ae01f4632fa12ebd3bea90b90ea1eb0b1c","observation_id":"46ec5300-70a3-4c60-a8f9-a7f7f07df7b7","resolution":{"observed_at":"2026-08-16T04:18:40.795844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11701","last_updated":"2025-03-12T08:45:15Z","snapshot_observed_at":"2026-08-16T12:50:50.237557Z","submitted_at":"2025-03-12T08:45:15Z","title":"A Survey of Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11701","snapshot_observed_at":"2026-08-16T04:18:40.171743Z","title":"A survey of direct preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.171743Z"},"links":{"cited_paper":"/paper/2503.11701","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:82882dd0ad6674d4860d08d4d8ea45942198d3dea6be21de451778e0d3747960","observation_id":"b99ca145-d560-4b7b-9ab4-46d5e33770e3","resolution":{"observed_at":"2026-08-16T04:18:40.171743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-16T04:18:40.205387Z","title":"Trustworthy llms: a survey and guideline for evaluating large language models’ alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.205387Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:89b40cd5340338885a0d8f8ffab9ba14671a5bacad835852a180cd707df8ef6c","observation_id":"5d16bf50-25f6-4d67-9b7f-da58c07bff7c","resolution":{"observed_at":"2026-08-16T04:18:40.205387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00254","last_updated":"2024-05-27T14:08:40Z","snapshot_observed_at":"2026-08-16T13:56:25.795152Z","submitted_at":"2024-04-30T23:57:23Z","title":"RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00254","snapshot_observed_at":"2026-08-16T04:18:40.210266Z","title":"Rlhf from heterogeneous feedback via personalization and preference aggregation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.210266Z"},"links":{"cited_paper":"/paper/2405.00254","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:5d3d915f27faa3e8a1795344bcadac415df3b597d87e7011731e8656c8e83547","observation_id":"1341ab5e-4e74-41a3-b22a-a327ab782103","resolution":{"observed_at":"2026-08-16T04:18:40.210266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.215067Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.215067Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:d241e9d4a0c591ee7c6b7379e865e279d5d6b26c971ef79d576a9e6be22607e3","observation_id":"3fd6d03a-72fb-401b-ac24-a6ebaf2a3947","resolution":{"observed_at":"2026-08-16T04:18:40.215067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T04:18:40.224347Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.224347Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:01b29d681eaed7c7de10348c4c632efb17a7dbbeab9b909a89330610206afaec","observation_id":"57710674-310b-406e-a080-2ada650490c2","resolution":{"observed_at":"2026-08-16T04:18:40.224347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15025","last_updated":"2023-09-26T15:49:23Z","snapshot_observed_at":"2026-08-17T16:09:43.865191Z","submitted_at":"2023-09-26T15:49:23Z","title":"Large Language Model Alignment: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15025","snapshot_observed_at":"2026-08-16T04:18:40.269907Z","title":"Large language model alignment: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.269907Z"},"links":{"cited_paper":"/paper/2309.15025","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:2c025586fb70f9cf5da2eba3d50b7f7dd006d0fb2c48ea8b3f945d23968ffa92","observation_id":"9953d08a-c9b7-499c-bc11-e479704e9215","resolution":{"observed_at":"2026-08-16T04:18:40.269907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.770563Z","title":"Things we like: human preferences among similar organisms and implications for conservation","venue":null,"work_id":"bfe2c31f-a1ae-42f3-bba0-56da59f7fff7","year":2007},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.307558Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:9e11f734c99c89d417acb1bd4efb0e3cdd164f12efcef20a62e1371f06a788d5","observation_id":"857476ab-f5b4-4fba-aeb0-c03eae9761fe","resolution":{"observed_at":"2026-08-16T04:18:40.775002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-16T15:13:42.128297Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-16T04:18:40.312439Z","title":"Aligning large language models with human: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.312439Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:0de8ea43215f8460e90fb5c9154c54e48ea8be5bdb66aba43dd032e0c10e5da0","observation_id":"7f60104e-3e48-426c-8b1a-31cc8ce16fdd","resolution":{"observed_at":"2026-08-16T04:18:40.312439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12088","last_updated":"2022-03-27T06:51:57Z","snapshot_observed_at":"2026-08-16T20:37:56.916414Z","submitted_at":"2021-10-22T22:42:11Z","title":"Learning with Noisy Labels Revisited: A Study Using Real-World Human Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12088","snapshot_observed_at":"2026-08-16T04:18:40.317605Z","title":"Learning with noisy labels revisited: A study using real-world human annotations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.317605Z"},"links":{"cited_paper":"/paper/2110.12088","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:ff72217c2d6d857b07b08664c3a22d916fd67fb04a07b12c429f43e844a39a47","observation_id":"793f0b0b-2aae-441e-a55c-c64bb7e2653a","resolution":{"observed_at":"2026-08-16T04:18:40.317605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-16T17:34:11.389619Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-16T04:18:40.424127Z","title":"Token- level direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.424127Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:d0d0319270fe9bd63125dfad3ae5ce201bfa1b7e55fabd1980dccd673f545ea0","observation_id":"5cd4cba5-630c-4b7c-9577-6982d9e9e87a","resolution":{"observed_at":"2026-08-16T04:18:40.424127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.610558Z","title":"Beyond one-preference-for-all: Multi-objective direct preference optimization","venue":null,"work_id":"a09187ab-155c-40ef-8846-9180eef17b68","year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.427730Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:0a29c6723764a915d141cdfb9f0514326ad732d866628de18d56d33a13bced4d","observation_id":"af46cbf7-a3e4-4e51-8ea6-658b6ce5e590","resolution":{"observed_at":"2026-08-16T04:18:40.678798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-16T04:18:40.431498Z","title":"chosen” and one “rejected","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.431498Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:2acd703026dd7312f3e4c6a997d12b4db601327a6668b3214c87c11ecb7a9019","observation_id":"05846fd4-7eb7-416d-b9ab-dea33d3e4f0f","resolution":{"observed_at":"2026-08-16T04:18:40.431498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T08:49:08.674244Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2505.01706."}