{"as_of":"2026-08-10T07:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:333c0ee2731a2b5ede46dd560696035fd40908a7aeab5a64bb474bcc19848f4e","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:15:24.417982Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20359/citation-record","integrity":"/paper/2505.20359/integrity","json":"/paper/2505.20359/citation-record.json","paper":"/paper/2505.20359"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:32.372404Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"27e72af1-4e72-4944-a95e-5fcbe6a40c13","year":2017},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.555869Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:b6595ec97366c62d928d438cda4a3080fe71117b8a02664c595bc59d452877b6","observation_id":"266962d9-0de5-4335-907b-edde5bb7c2c1","resolution":{"observed_at":"2026-08-07T14:15:32.477197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:32.236372Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"dd7256e7-ee01-43c3-b72d-9421a0e9492b","year":2022},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.609106Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:dea3cd29634569b6804fff0feff83a59f1c710cb0cf2801729162fc40c5991d9","observation_id":"285f0b01-dcc3-4a49-b6fc-1ed7e24fb668","resolution":{"observed_at":"2026-08-07T14:15:32.298990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:15:18.705132Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.705132Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:b5ac657499b5cb0d429784053f99aa2402a62c596dfaf192e904c7712c46dcec","observation_id":"38a75ca1-948a-406c-81f7-5adadf20053f","resolution":{"observed_at":"2026-08-07T14:15:18.705132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:32.102830Z","title":"Preference ranking optimization for human alignment","venue":null,"work_id":"5c79cf62-0745-462f-8f16-e27bcd088757","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.798998Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:efc8b6158fd25b571da52405dc62c21584eeb9cdebc5e3de652f8b09ba23cb97","observation_id":"3b4f0662-34d9-4000-b1e0-c93c88229940","resolution":{"observed_at":"2026-08-07T14:15:32.168523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:31.928545Z","title":"Direct preference optimization: your language model is secretly a reward model","venue":null,"work_id":"485de98c-ea8b-40d2-b55e-2d44ff594be3","year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:18.934357Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:7ce66540815da26d4ca774bfec6eb5177713a336cbdbba92c64cfeaf3d6278b1","observation_id":"56a70f41-33c8-4d05-b0b9-dac4aa0d49bd","resolution":{"observed_at":"2026-08-07T14:15:31.995327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:31.807201Z","title":"Beyond reverse kl: Generalizing direct preference optimization with diverse divergence constraints","venue":null,"work_id":"f6410616-4156-4278-9200-62aafea9c656","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.071460Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:518a257b013e450bcf76aa61a25c55310f7fb3ad512a7bc8d4d395c98625d6d7","observation_id":"28c46a98-b358-433f-b7ed-3b179786fa5f","resolution":{"observed_at":"2026-08-07T14:15:31.866830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:31.697235Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"04a7e20b-5802-40b8-ae41-6fae054350c9","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.203169Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:0323dc5f82ee882109f6063bc9bc4751e03979612b3d3ea13048c5e51a5133f9","observation_id":"4694cf76-44d0-485d-b000-c4f32623e342","resolution":{"observed_at":"2026-08-07T14:15:31.742338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19316","last_updated":"2025-03-03T08:22:25Z","snapshot_observed_at":"2026-08-02T12:00:09.704648Z","submitted_at":"2024-05-29T17:39:48Z","title":"Robust Preference Optimization through Reward Model Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19316","snapshot_observed_at":"2026-08-07T14:15:19.345978Z","title":"Robust preference optimization through reward model distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.345978Z"},"links":{"cited_paper":"/paper/2405.19316","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:f326d1d64c1a17186831ff9466c0d378adc6e376b3fb8a86b759d39a9b71eb49","observation_id":"1acd4098-80ed-4623-bbf1-898a97b2c34f","resolution":{"observed_at":"2026-08-07T14:15:19.345978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-07T14:15:19.460292Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.460292Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:39aad7aaa5340d2926dc19607596a24742dcc72a687a067197bed86c790d288b","observation_id":"6748e5cc-8e5e-46e6-8f2f-fd9d81909661","resolution":{"observed_at":"2026-08-07T14:15:19.460292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:31.583322Z","title":"Token- level direct preference optimization","venue":null,"work_id":"4d9c6252-fa98-4cc2-85e9-257fd7728d95","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.595079Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:34030d2459b23e3d74fc912888cd04761eb05695a5403fef1c71240a3b65d663","observation_id":"2e749cdd-98e1-442a-bcbc-3b0a56471f0e","resolution":{"observed_at":"2026-08-07T14:15:31.639826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:19.714328Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.714328Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:bd6a138ab8f5c2f5a6ea8050eea8ad910291a9fee1b7eb9ae1d1bf3a8d7a3fc3","observation_id":"628382ae-80bc-4de9-9d04-301eec9e6575","resolution":{"observed_at":"2026-08-07T14:15:19.714328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:19.881577Z","title":"Deep reinforcement learning: A brief survey","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:19.881577Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:16c3db6b6ca8c14ae2854529a0fe8011038539a1775baf8c2492ba497e816f65","observation_id":"41a12a3d-99c1-43a9-a0e0-857624ca58b5","resolution":{"observed_at":"2026-08-07T14:15:19.881577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:20.030535Z","title":"An introduction to deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.030535Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:770d1725e265eb126b95e66f985d7034f4231dc0fecbf7d2fbd22a0d6e2a0e77","observation_id":"f60c15d1-a973-4088-a52a-b246dcbf9a86","resolution":{"observed_at":"2026-08-07T14:15:20.030535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:31.396024Z","title":"Robust risk-aware reinforcement learning","venue":null,"work_id":"ee906e82-d9b6-4c96-becf-75e342011af7","year":2022},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.197325Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:c3d9d7e7e05d5ba39b20deefae64ade17ce5b604542ebd448cf79791bda9a321","observation_id":"019c4f99-7a71-4f5d-a89f-f18fe1d21e10","resolution":{"observed_at":"2026-08-07T14:15:31.441474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:31.259262Z","title":"Risk-averse policy optimization via risk-neutral policy optimization","venue":null,"work_id":"80a33e22-3bfd-4945-acea-1ba79c28a2e9","year":2022},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.309724Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:980897e3876a3523ca024e7d2f7eab86320caacb7274981bc8b1212ce10fb355","observation_id":"e1b1f053-a824-4fc5-94cc-ebf63d3cfc0a","resolution":{"observed_at":"2026-08-07T14:15:31.321843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:31.144492Z","title":"Risk-aware controller for autonomous vehicles using model-based collision prediction and reinforcement learning","venue":null,"work_id":"723d22bd-b4af-483e-9188-8fc8558cce97","year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.466741Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:d3efd2ca1209be4a6922a74093fed039611582e1cc5c327fd6fc9ae3c4e69295","observation_id":"80b1104b-33e1-4da0-baa3-3799545f81f0","resolution":{"observed_at":"2026-08-07T14:15:31.198241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:31.032483Z","title":"Risk-averse fine-tuning of large language models","venue":null,"work_id":"ab216c7a-243e-4f7d-bb1c-e4b8a569d32b","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.594897Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:77f3a5bdaaa8f2bd2e8014af4023b6daca4dedb8603acd24a48ac500ee09b717","observation_id":"61e19d94-d1c2-4b6f-996d-c09147e1a57b","resolution":{"observed_at":"2026-08-07T14:15:31.091831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.958757Z","title":"Model alignment as prospect theoretic optimization","venue":null,"work_id":"2f9dacaf-be7f-4e25-9bff-9bd31b9f31ec","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.752174Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:7cf003330b2366d7b0da7907e036a223f4156165568db7e4a6d6c429888cf440","observation_id":"9c2fec67-6fc3-4b51-8f77-c14aac02b2ad","resolution":{"observed_at":"2026-08-07T14:15:30.986076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.798074Z","title":"Advances in prospect theory: Cumulative representation of uncertainty","venue":null,"work_id":"2e46532c-1ff5-4227-86aa-b098d5e7e2f3","year":1992},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:20.878414Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:cbe92da702cfd329b9709a10426c8b314369c5ec39661adecfb4220ab2a7a685","observation_id":"267f7619-4325-47a3-afdf-2820c0c843b5","resolution":{"observed_at":"2026-08-07T14:15:30.894237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:21.101329Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.101329Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:77bf33ca4a44f9930fa92709a548cee9ac62db017edb2ff60201a2aeb8bf7abc","observation_id":"8eb6289a-eb4e-4873-8a7c-3bcf57af824f","resolution":{"observed_at":"2026-08-07T14:15:21.101329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.596556Z","title":"More risk-sensitive markov decision processes","venue":null,"work_id":"054d7f62-1786-4c09-8bc7-3da0a7e9f6fb","year":2014},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.205496Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:7dec4b4e00c5947a995885207d003432a946d52ad87066899f1f05beb49864eb","observation_id":"046ef407-7718-4744-9e95-3dce0d99a81c","resolution":{"observed_at":"2026-08-07T14:15:30.669560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.462018Z","title":"Risk-averse autonomous systems: A brief history and recent developments from the perspective of optimal control.Artificial Intelligence, 311:103743, 2022","venue":null,"work_id":"6dcb9f42-7603-457f-b739-5a6b865b9bca","year":2022},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.317906Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:4ce89b7e4090d37de384f2e6170b9575611a8fc1e99374873183073fbcdd0df8","observation_id":"3408fba7-558e-4add-ac04-21632c2eb58d","resolution":{"observed_at":"2026-08-07T14:15:30.518194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.282200Z","title":"Thinking coherently","venue":null,"work_id":"4d07f34a-83c2-4a06-ab50-b6724b3c1a01","year":1997},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.373720Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:b2db525697b2ba269e610baf9ecd4586dd92e8774caabdaa5ec48ec2cf6c9803","observation_id":"969f46a1-2a6a-4576-a4bc-d0fe256675c2","resolution":{"observed_at":"2026-08-07T14:15:30.345849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.173094Z","title":"Optimization of conditional value-at-risk","venue":null,"work_id":"8aec5628-f408-4835-bd7d-b45e6e58dabf","year":2000},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.432352Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:066f3c153d15e454e6a075bca2d606bd8dfcd108babe55c861e611298d62a1bb","observation_id":"aad407c8-9b36-4909-b2f0-22888e191e79","resolution":{"observed_at":"2026-08-07T14:15:30.213248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:30.090239Z","title":"Risk-sensitive and robust decision- making: a cvar optimization approach","venue":null,"work_id":"e64a6f0b-b03e-4e1d-8bfb-935ba8738460","year":2015},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.477336Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:1914d1d291a5226a8b147f805a2d096c9f8f112a7c9b7f2fe3dd2696fa41afb8","observation_id":"5677c95c-c45a-4d81-be50-685ee6e45259","resolution":{"observed_at":"2026-08-07T14:15:30.125316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:29.919176Z","title":"Convex measures of risk and trading constraints","venue":null,"work_id":"eaf48af0-75df-4319-b292-56a3289db181","year":2002},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.532142Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:27381788e3268c615042d377e06089e27cb9c0b152e3263d79d2dc9af927ac61","observation_id":"27664587-af4a-4cd0-a591-f7eb4d4d4d58","resolution":{"observed_at":"2026-08-07T14:15:29.998074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:29.597371Z","title":"Entropic risk optimization in discounted mdps","venue":null,"work_id":"88e6f675-d5d2-45d0-9dad-bd311c822ab3","year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.594078Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:a22e9d64a3f618d76edcf6d85b6a3feb0ea8f00a60231e07d51706f2ab378622","observation_id":"e883111d-e3b5-471a-8f7c-9a8adbfd4799","resolution":{"observed_at":"2026-08-07T14:15:29.757999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:29.355394Z","title":"Risk-sensitive reinforcement learning: Near-optimal risk-sample tradeoff in regret","venue":null,"work_id":"aa23d092-9fa9-473e-9e5c-21b95a6bc68c","year":2020},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.642270Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:1b13696efa48c8dcf3f993396c31a94e961a529f7e816a1f3b5d2e311fa48be6","observation_id":"5116fd70-e7fd-46bc-867a-ba14c3ef4064","resolution":{"observed_at":"2026-08-07T14:15:29.466612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:29.109132Z","title":"Provably efficient iterated cvar reinforcement learning with function approximation and human feedback","venue":null,"work_id":"7e267bde-feab-41e9-8ee7-c0446e966f66","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.717663Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:18b8560bc920f0e91a925a1022de2f10bae28cfc9520a2ab6ebbab0d9c78d64a","observation_id":"f8f48a59-0ae5-4b6f-ab37-d8db67b42722","resolution":{"observed_at":"2026-08-07T14:15:29.226939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:28.863663Z","title":"Ra-pbrl: Provably efficient risk-aware preference-based reinforcement learning","venue":null,"work_id":"5a4ad094-c761-4faa-837b-4f586a989944","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.798858Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:1693d60adfbb3fc980552f387643ac75f3123584a6449a7f90e2ae786fb127cb","observation_id":"cd7353c2-64ae-46b7-a2db-1cba3c3a5c81","resolution":{"observed_at":"2026-08-07T14:15:28.987173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:28.584327Z","title":"Entropic risk optimization in discounted mdps","venue":null,"work_id":"bda7b7ca-5d1e-451e-bfbd-462e2413a767","year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.886758Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:b07a5e3691c9bc8a4a13d7d1ba1297462600443f912ac86f1139da763f3b850a","observation_id":"fbc31907-6796-4714-a501-2f634b0f1df0","resolution":{"observed_at":"2026-08-07T14:15:28.709483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:28.354596Z","title":"Learning word vectors for sentiment analysis","venue":null,"work_id":"9641475e-473e-4d39-ad50-e39f9b28cb6a","year":2011},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:21.973558Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:d3ceae53e69d4426616a10a580961835102b07e4a5535722834713a4601dccde","observation_id":"04727585-b3ef-4b86-8cdd-c5b37b83ca81","resolution":{"observed_at":"2026-08-07T14:15:28.435952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:15:22.071225Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.071225Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:ceb6676d2bd90cbf3d44f2d1631d3772b89e1c4076fffe6b4c5eab36c456dd04","observation_id":"4818b965-e2b0-4826-922e-1f8e6ca1a900","resolution":{"observed_at":"2026-08-07T14:15:22.071225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T14:15:22.175187Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.175187Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:6b8a6f27b2006dc94a7aaee1a772e52e505611c4171cc8f277abc9b388bf9e00","observation_id":"990f0832-084c-4bab-a0aa-4bfc1ec7618d","resolution":{"observed_at":"2026-08-07T14:15:22.175187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:15:22.269080Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.269080Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:02498ae4c846d8689887b88c3375963fcd3a0d492491ab2536b95d3420bca274","observation_id":"afc58c1c-08da-478c-b814-543f0ef3790d","resolution":{"observed_at":"2026-08-07T14:15:22.269080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:22.384512Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.384512Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:5e0a97fb0566bcaca747f2e7931d6060bd7ff0f5c1a3da713eafa0d0e44b1924","observation_id":"edd5acce-2221-4fbe-98e5-61ef5cb0f7a9","resolution":{"observed_at":"2026-08-07T14:15:22.384512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:28.065704Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"f7d8d944-be58-49b4-9cdf-f289f367c14d","year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.479912Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:0b9113d8822a59ebde37ea382e14c185d5708a98d68178d1eb93e6a5c8af3d95","observation_id":"55b57b8d-0628-4271-910d-60cdb8250eb7","resolution":{"observed_at":"2026-08-07T14:15:28.157463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T14:15:22.576261Z","title":"Red-teaming large language models using chain of utterances for safety-alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.576261Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:62e242178261182dbd61f3ca3d1175d8d2b16a7b737e2afdf520f611f2cfcd70","observation_id":"be60ffa7-ae5f-4129-a599-cc034230db8d","resolution":{"observed_at":"2026-08-07T14:15:22.576261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.851632Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":"c1a21329-d730-486d-adf4-2a7c5382d2aa","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.651044Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:ad03b6ab01ae680edb2e938b0c52a90dc031f32b6c69c4d75a7fbfa08f4f9b99","observation_id":"2c902023-c0ca-42ef-9ffb-bd7900bc5260","resolution":{"observed_at":"2026-08-07T14:15:27.953097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01957","last_updated":"2025-05-01T17:40:14Z","snapshot_observed_at":"2026-08-09T00:57:38.984665Z","submitted_at":"2024-10-02T19:03:42Z","title":"Challenges and Future Directions of Data-Centric AI Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01957","snapshot_observed_at":"2026-08-07T14:15:22.733585Z","title":"How reliable is human feedback for aligning large language models? arXiv preprint arXiv:2410.01957, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.733585Z"},"links":{"cited_paper":"/paper/2410.01957","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:7b95d7dfea935d1a1b37d9131737a30a52d4bf3f0d2a1662f376621cad2b5511","observation_id":"5c888fa5-67c1-4b57-a5eb-a607d4ba7166","resolution":{"observed_at":"2026-08-07T14:15:22.733585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.720546Z","title":"Fine-grained human feedback gives better rewards for language model training","venue":null,"work_id":"50be1048-5bd6-46bf-b94c-4efce0a163ff","year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.802805Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:ed68e6b3143f0a576c1fde431d36636256963d4db4ec30808f818d83c4686df3","observation_id":"9f732037-9151-42d8-9766-eab794e6bd58","resolution":{"observed_at":"2026-08-07T14:15:27.782998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00722","last_updated":"2024-11-01T16:36:14Z","snapshot_observed_at":"2026-07-06T19:43:42.287026Z","submitted_at":"2024-11-01T16:36:14Z","title":"Token-level Proximal Policy Optimization for Query Generation","version":1},"cited_work":{"arxiv_id":"2411.00722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.00722","snapshot_observed_at":"2026-08-07T14:15:24.576304Z","title":"Token-level Proximal Policy Optimization for Query Generation","venue":"cs.LG","work_id":"d0f5e362-7001-4d76-8902-116d76f1ff19","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.850475Z"},"links":{"cited_paper":"/paper/2411.00722","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:130e2a815b5dfcee68c8783764ade9af0cb34e7c2a7658b17a6cd6b5efdb2a69","observation_id":"453b2863-17e6-4044-a57b-42e25ce55c33","resolution":{"observed_at":"2026-08-07T14:15:24.647583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:15:22.914266Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.914266Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:5de7ee4eeea0d6e83e07ecd0ad0aa58e7f5dcf895aabd44e86699ac5b9404162","observation_id":"210d9d09-36b8-4659-8815-dbd3d517a8d3","resolution":{"observed_at":"2026-08-07T14:15:22.914266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:15:22.964183Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:22.964183Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:fc6d8a16e06f5e96d19417961ecf262df24fd643356dbcb056a72f8b52ad7dbd","observation_id":"f9ed9aca-f69c-4703-b401-a43c91b3fe3b","resolution":{"observed_at":"2026-08-07T14:15:22.964183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:23.064520Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.064520Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:7efbe58b76b19db0a049473b040e504fa039e7a9f1503a110c89ff5591fa96cb","observation_id":"27b7eca0-57dd-41bb-95bf-66977aa009c7","resolution":{"observed_at":"2026-08-07T14:15:23.064520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:23.142797Z","title":"Reinforcement learning in robotic applications: a comprehensive survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.142797Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:aeb8a88f6a8ac0ccbb2837e2da698722b7e2b267f5b9b9acf1c748a7dc2a8911","observation_id":"3d8eee37-33f2-4a77-85b6-1be95e1961b7","resolution":{"observed_at":"2026-08-07T14:15:23.142797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.543103Z","title":"A review of safe reinforcement learning: Methods, theory and applications","venue":null,"work_id":"53bc0816-4935-4481-8b2d-e0fa8eb3d1d3","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.279032Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:ef9a02bd34c200de2e34918d31eb0afe1b4842909d9de6ff0c9aec40aae1af7d","observation_id":"f0221ff5-480a-474c-bdda-4bbdfb0f7627","resolution":{"observed_at":"2026-08-07T14:15:27.602650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.355030Z","title":"Risk-sensitive reinforcement learning with function approximation: A debiasing approach","venue":null,"work_id":"a0c04ee3-a044-4b37-8087-751342e530cb","year":2021},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.383108Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:a79395ffa674bad7065dd11eb74b4f47366c3f029b9496c11439d0b1d04ffb89","observation_id":"f82a1cbf-d09e-4721-af42-baa7dbf92d6b","resolution":{"observed_at":"2026-08-07T14:15:27.480888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:27.129866Z","title":"Regret bounds for risk- sensitive reinforcement learning","venue":null,"work_id":"09b6e739-ce50-46bd-919a-7bc8f5c90f69","year":2022},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.481362Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:d0128853adb296f5858c8403fe38a8e935436d3b9d6bc7ae88b7e8490d7b046b","observation_id":"24df7347-0acc-4d65-a3b6-311d8275634b","resolution":{"observed_at":"2026-08-07T14:15:27.245057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:26.881804Z","title":"Near-minimax-optimal risk-sensitive reinforce- ment learning with cvar","venue":null,"work_id":"4bc69c4c-8106-4ed8-8eb3-aed76495f4ae","year":2023},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.599532Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:ca14f98954c00a284e590619c0af8cc298a5b3dcfdac5f2349a60be11356898d","observation_id":"f58e3802-5610-4ee6-9723-da7b420fa2a6","resolution":{"observed_at":"2026-08-07T14:15:26.980660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:26.624142Z","title":"Provably efficient risk-sensitive reinforcement learning: Iterated cvar and worst path","venue":null,"work_id":"fd31eeb6-9cf3-4b94-9f38-9fc1737f379c","year":2022},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.675659Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:e7784f724b43f1e742e23cbbb3bb792e8d4865d9fb984e74853c999ea0d975cd","observation_id":"af5d9855-4ba9-46ce-b257-88718fb48075","resolution":{"observed_at":"2026-08-07T14:15:26.734868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:26.357419Z","title":"Group robust preference optimization in reward-free rlhf","venue":null,"work_id":"2ffe2b95-4ffb-4954-9fb5-b28fccad461f","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.778098Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:01094423eb2a9c5d9454d783743ef5e2996539c81a5f0b50dbf302eb94786536","observation_id":"70dc62a2-eda3-4005-b2a4-3df23f485650","resolution":{"observed_at":"2026-08-07T14:15:26.458476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:26.074941Z","title":"Preference learning of latent decision utilities with a human-like model of preferential choice","venue":null,"work_id":"4b1d405a-d0a6-400b-b3af-3ecc3d14c9cf","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.884353Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:02d38c159bfd318b3228da6a1a5eb75191a76d3cc52b1d15e81c534d06ffa50f","observation_id":"3073a4cc-e426-48f6-bd5f-f2bedbe07e9e","resolution":{"observed_at":"2026-08-07T14:15:26.197413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:23.965754Z","title":"Robust reinforcement learning","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:23.965754Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:72250aa3134a10949103eb53711806133dc93c9c66fb83b4c5d0b8eecb668c6e","observation_id":"f8f11223-2e07-44ab-b68a-84d7639b6110","resolution":{"observed_at":"2026-08-07T14:15:23.965754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:25.792241Z","title":"Hamilton–jacobi reachability: Some recent theoretical advances and applications in unmanned airspace management","venue":null,"work_id":"36c90616-3f9b-40a1-8865-f8713a74185d","year":2018},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:24.031706Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:9290c0a12b1606b7161e36e6aa2b4e1cfff3f9c67ff8a2df37edb557a0e4f3ad","observation_id":"c9c72cd9-3543-43cf-8eb5-39307002d122","resolution":{"observed_at":"2026-08-07T14:15:25.942242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:25.507128Z","title":"Coherent measures of risk","venue":null,"work_id":"ae166f90-e71b-4a93-af12-c1554bd2156e","year":1999},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:24.147492Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:63a9e542dcc736001479de8080809fac85b30511309cc11876a96b66342def3c","observation_id":"c25ac1db-d5b9-4181-a928-fc07e0521b8a","resolution":{"observed_at":"2026-08-07T14:15:25.638808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:25.350443Z","title":"Equivalence notions and model minimization in markov decision processes","venue":null,"work_id":"913b9681-7810-4cf9-a787-1084513ad50f","year":2003},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:24.228406Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:bce56d1855d695b1c82bfe2529c2d06cd4b5dce1ff4ffcb383a0f80f356fb602","observation_id":"4b01fe23-d627-4dd6-9598-e16e97fe3144","resolution":{"observed_at":"2026-08-07T14:15:25.411257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:25.123860Z","title":"Learning markov network structure with decision trees","venue":null,"work_id":"eb4cdc5d-8b9c-4bd6-ada6-93d691ec1905","year":2010},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:24.321204Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:7cb89eb1631ca110a56e150d4313789cb9f3cc5cd9f77d2b529a483c2429bf3e","observation_id":"db018505-bb46-4dd5-8dd1-cfeeb1fe5048","resolution":{"observed_at":"2026-08-07T14:15:25.250218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:15:24.978300Z","title":"∞X t=1 γt−1 R x, y<t , yt + γ Φµ ˜Vπ x, y<t+1 − ˜Vπ([x]) # =Eτ |π′","venue":null,"work_id":"99073e39-ee34-4f1e-b2a5-f35be7f82155","year":2024},"citing_paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:24.417982Z"},"links":{"citing_paper":"/paper/2505.20359"},"observation_digest":"sha256:b67b5b547c138b0f4511d302f7c5458fd55d6c4fff4953e803a2d0c76aee3c53","observation_id":"459a203a-5ae4-4887-83ed-acbff5a8a225","resolution":{"observed_at":"2026-08-07T14:15:25.040781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20359","last_updated":"2025-05-29T13:19:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T00:58:00.522901Z","submitted_at":"2025-05-26T08:01:37Z","title":"Risk-aware Direct Preference Optimization under Nested Risk Measure"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2505.20359."}