{"as_of":"2026-08-17T00:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9353a50c103d899f2047a6f28acdb6bd3fe743c39a82ecc2b38fb3e0803b431","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:40:18.315140Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15906/citation-record","integrity":"/paper/2507.15906/integrity","json":"/paper/2507.15906/citation-record.json","paper":"/paper/2507.15906"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:21.075814Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"d3e2d548-c2ea-4516-89f8-5ea9138c97db","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.176395Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:aefd9569a28d08f7679700c9000bb2c61868299a814f468905260f593d9f42cc","observation_id":"d809cf6f-ee7c-4ffd-892d-e7588102b78c","resolution":{"observed_at":"2026-08-06T15:40:21.156461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T15:40:13.266168Z","title":"The llama 3 herd of models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.266168Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:40d753a0bc8f84ed110da0346cd50a5109ebf6836b9ca357f6ebe7c71d1ec1b8","observation_id":"47697553-f704-4bb3-82e3-bfc825ef34c7","resolution":{"observed_at":"2026-08-06T15:40:13.266168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T15:40:13.333386Z","title":"Concrete problems in ai safety","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.333386Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:51e4255b2ce3e68a484a4e2c94915fe0f443c00001525aac95e92556817e38c1","observation_id":"ee77b394-d87e-49f6-8280-3c14d712c9cb","resolution":{"observed_at":"2026-08-06T15:40:13.333386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T15:40:13.417979Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.417979Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:73d3a908179bff8c6cde5f6076a3367ece63600c9affb2d0b913412bc2f1f292","observation_id":"fbb27280-7859-4c32-8d4f-a42d30e3c2f0","resolution":{"observed_at":"2026-08-06T15:40:13.417979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T15:40:13.494528Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.494528Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:65da800c0a510965b9419adb05722c727e1abea0ba23be3f58312951e0a1c058","observation_id":"48ae5dfa-eb9f-465e-aa15-b6cc4542ab59","resolution":{"observed_at":"2026-08-06T15:40:13.494528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:13.621778Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.621778Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:1f47b8010b38d00d02af190dd54ba25f4a815734d533db9e12128d691d5dc425","observation_id":"1728c136-ef99-4e4d-a6ff-0be5e299c464","resolution":{"observed_at":"2026-08-06T15:40:13.621778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-16T14:55:10.453487Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-06T15:40:13.721341Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.721341Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:72111b57277d481dffdd7a05d8788e7d5b15b4f1558f01a7134e7bec9d06b6cf","observation_id":"d81661bf-1992-4d60-91f9-a40889259d1e","resolution":{"observed_at":"2026-08-06T15:40:13.721341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-06T15:40:13.818475Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.818475Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:0ab7ebee80bd308b997b984c78164bd14bdd113f11b5ae7fbbd2fbb7e56eeb9a","observation_id":"08da191c-c502-4312-bed6-4226835d001c","resolution":{"observed_at":"2026-08-06T15:40:13.818475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.858766Z","title":"Suphavadeeprasit","venue":null,"work_id":"797dfc65-a426-4822-9c6d-dd1705ffe518","year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.865665Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:9ce633bcacfb65415aec865272d22a9bd622bb60e72ef5032d8d2452a7419e18","observation_id":"1d279d30-0dcf-4f19-bfaa-89c952a0a89f","resolution":{"observed_at":"2026-08-06T15:40:20.952919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.711452Z","title":"Gemini 2.0 flash: Next-generation multimodal ai model","venue":null,"work_id":"845ae6fd-3823-4ab1-82cd-b49a06b22d33","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.944596Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:68cf4e2e895495e45b0bb34a86963cbb3ccaf31843e39a10ac3b5c7a08d6000a","observation_id":"5e10c0f0-fb17-4bfe-9a8f-44419e76630c","resolution":{"observed_at":"2026-08-06T15:40:20.783795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T15:40:14.010645Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.010645Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:0609b760b1c1f46f7dbae77a154c0f2d4e2ed53ee8c2cfc4c089408d79c1737e","observation_id":"1361e871-f6d0-4c4d-9c6c-b5e0025049e2","resolution":{"observed_at":"2026-08-06T15:40:14.010645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:14.132426Z","title":"RAFT : Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.132426Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:b61b82bb40b44da643c6983eb0d7a6294e5d953ac30fff150bfb7325e3ba6205","observation_id":"97e0d881-e718-487f-a5bb-1e108dcacce4","resolution":{"observed_at":"2026-08-06T15:40:14.132426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-15T18:13:42.319653Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-06T15:40:14.208038Z","title":"Rlhf workflow: From reward modeling to online rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.208038Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:ed7536d8618f77881e841ded49d636b301e241f5d6348f466f76e4a6d12e8712","observation_id":"e91f2dfc-d7f7-4e9b-8792-7f4fef976c8f","resolution":{"observed_at":"2026-08-06T15:40:14.208038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-16T14:34:38.657827Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T15:40:14.278132Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.278132Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:b57c16a51a9cbef8f4767f999a0c03285bed746bca853fe563ad432d2b550626","observation_id":"d2b52343-ad36-4d03-85ab-8d46ab45da4f","resolution":{"observed_at":"2026-08-06T15:40:14.278132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.493973Z","title":"Understanding dataset difficulty with v-usable information","venue":null,"work_id":"6808699d-3af0-433f-8ad0-1b173022aa0f","year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.350372Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:cf10de0dbb6a69695ba4c029daf87434940f8f2f6d285d463153c7d45a255946","observation_id":"0e5c7de4-926c-4d9f-8825-509c26dcdb16","resolution":{"observed_at":"2026-08-06T15:40:20.612471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.310809Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":"a8659636-f5b3-47e8-b17f-33008fdb2fba","year":2016},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.467970Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:669b2ea66557bd65a542301dbe38d14cd94f964638bf21589aadfba6c8fee6eb","observation_id":"cd467f85-11b8-4976-a8fe-6efab80bbead","resolution":{"observed_at":"2026-08-06T15:40:20.401191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:14.648398Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.648398Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:70e8b9568a786b2f3fdd0d74e9ef9be4c5612dfe918c7bd9bc63c93818bc3b5d","observation_id":"4115c2db-0a6e-4527-b18e-31c2da76f903","resolution":{"observed_at":"2026-08-06T15:40:14.648398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:20.154837Z","title":"https://huggingface.co/google/gemma-2b, 2024","venue":null,"work_id":"a8120e27-49c4-45e0-8fe8-ddab996b81de","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.807037Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:124fbbb72a947569819d541d46be235a7e709dc1b8fc66a9cbc6daf2fd08696d","observation_id":"8f8c4ae2-e1e8-4d32-b9a1-69738b2f53c3","resolution":{"observed_at":"2026-08-06T15:40:20.250009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:14.973348Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.973348Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:fcd6041907b076a09a9db62c7aa9c356957dbe2fdb1bc8564a5d9b07c0d282d2","observation_id":"1dc032e9-a02f-4dce-b96d-6b068474f4da","resolution":{"observed_at":"2026-08-06T15:40:14.973348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T15:40:15.092213Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.092213Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:e051a3d2adf35713e50a6c32a8d4ce363fa818fd93b0b6f7c2a307242afd1402","observation_id":"0130163d-ee01-4d80-8e01-84e6c0938b5b","resolution":{"observed_at":"2026-08-06T15:40:15.092213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-16T15:52:16.749650Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T15:40:15.257918Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.257918Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:25fefd7502feefa56f4c43d75208c8c9869c0a166493aef1678976835ae6da82","observation_id":"33e0d3f5-5f7a-4d3d-a8d7-a3ec2544814f","resolution":{"observed_at":"2026-08-06T15:40:15.257918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-16T14:07:56.582345Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T15:40:15.368188Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.368188Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:83df770b6cbe7d3241e95b7b14dff1ba676547f40f94ed5f73c9e5342d66637d","observation_id":"61587e0a-0251-4e40-b1ba-8cc8fee53523","resolution":{"observed_at":"2026-08-06T15:40:15.368188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:15.487856Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.487856Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:797709c5253320f71fc89cd5a39466f063a6af67043c7f40268af3deb9a7581f","observation_id":"24b201b5-75dd-4e28-9733-9bee5051bfbc","resolution":{"observed_at":"2026-08-06T15:40:15.487856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.941203Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces, 2023","venue":null,"work_id":"078bcf8e-d236-4184-bd6a-d5b977c5b80f","year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.623570Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:3082d70e54036175a2ef98f51f80cf9b2bc8a554dcc17363c42cee47b153e3c9","observation_id":"6f0b80df-145c-4ef6-af21-d3a6aedfcba2","resolution":{"observed_at":"2026-08-06T15:40:20.024665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12401","last_updated":"2022-05-24T23:22:10Z","snapshot_observed_at":"2026-08-16T16:57:55.107634Z","submitted_at":"2022-05-24T23:22:10Z","title":"Reward Uncertainty for Exploration in Preference-based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12401","snapshot_observed_at":"2026-08-06T15:40:15.689847Z","title":"Reward uncertainty for exploration in preference-based reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.689847Z"},"links":{"cited_paper":"/paper/2205.12401","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:cdec1d9e5cc7e8eba1c8ea5a689f2385b218ec3dc6bdb845fe23c456d04c965b","observation_id":"1544c899-73e4-4a7b-9a41-91ea72ae8d17","resolution":{"observed_at":"2026-08-06T15:40:15.689847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.778889Z","title":"Iterative prompting for estimating epistemic uncertainty","venue":null,"work_id":"6bf6a4ed-8ebc-4890-b814-20bd397779e2","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.762639Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:1c66a3a4729d02451206cb6c1bdd2ff70e83b60903b0629ab725625255d648e2","observation_id":"0babacde-4ada-4f0a-adcc-94e46862e9e8","resolution":{"observed_at":"2026-08-06T15:40:19.849773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00847","last_updated":"2025-02-12T03:34:29Z","snapshot_observed_at":"2026-08-16T13:13:39.851077Z","submitted_at":"2024-10-01T16:29:59Z","title":"Uncertainty-aware Reward Model: Teaching Reward Models to Know What is Unknown","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00847","snapshot_observed_at":"2026-08-06T15:40:15.880022Z","title":"Uncertainty-aware reward model: Teaching reward models to know what is unknown","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.880022Z"},"links":{"cited_paper":"/paper/2410.00847","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:c5be207a8bb10a314fcc56d7cb820cc58b3b60d0f06b8f1235a455bbb7ecb4e3","observation_id":"902799f6-fb92-4983-98a6-59f7a3fff674","resolution":{"observed_at":"2026-08-06T15:40:15.880022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:15.957662Z","title":"Introducing meta llama 3: The most capable openly available llm to date","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.957662Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:2e0262405842a270791b08cca11d9522d2fb92c589bf5adb4e4593d9675a137f","observation_id":"28c4d9ce-4dcc-4d52-85c6-fc6d793041e9","resolution":{"observed_at":"2026-08-06T15:40:15.957662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.534395Z","title":"Montgomery and George C","venue":null,"work_id":"46f29af5-c867-4db4-8182-0e107dd06bad","year":2014},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.020519Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:f50a125c8be1d91fef087508e11fb7018f95416c49b7751a70732c9386d88db3","observation_id":"e439b574-48dd-419d-a3bb-64f9c38ba7af","resolution":{"observed_at":"2026-08-06T15:40:19.638664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:40:16.098615Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.098615Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:8ce4997d287c1e0c279b428eb09f353b3f0f963fba1cf67faaedc7665e1a5f9c","observation_id":"757574e9-7c31-43a4-abd1-614f6e78f258","resolution":{"observed_at":"2026-08-06T15:40:16.098615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.193548Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.193548Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:b460ceece6c01683558e02214b360a2d23d6d61e9f5df3e53c3bda847bea3da7","observation_id":"91246783-23e2-48a4-8de0-3e8e6fa149ca","resolution":{"observed_at":"2026-08-06T15:40:16.193548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.285137Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.285137Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:2717b8ea607bc1d87866dca5ffb78d2aa78c78e2ddd0a02c9c5371132019f276","observation_id":"18c522b9-122d-4a4a-adbd-92b17f02a131","resolution":{"observed_at":"2026-08-06T15:40:16.285137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.368788Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.368788Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:80abd0fed4a94aef5ee3438b4bc02d36cde30d259e8b9d21cf539635aba3804a","observation_id":"57c3ab16-89df-48eb-a27d-8adab523beee","resolution":{"observed_at":"2026-08-06T15:40:16.368788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12187","last_updated":"2024-01-22T18:27:08Z","snapshot_observed_at":"2026-08-16T14:25:27.754821Z","submitted_at":"2024-01-22T18:27:08Z","title":"WARM: On the Benefits of Weight Averaged Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12187","snapshot_observed_at":"2026-08-06T15:40:16.470462Z","title":"Warm: On the benefits of weight averaged reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.470462Z"},"links":{"cited_paper":"/paper/2401.12187","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:cf435ff7abb4f2caba9ff7f374311dd882cf54558c0779f61f1a532e458292f0","observation_id":"5650bcbd-ea5c-4a08-9b87-388f4fe98063","resolution":{"observed_at":"2026-08-06T15:40:16.470462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-06T15:40:16.538614Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.538614Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:aa2bca633c3de0dd5166943ce116997d1e718bc39efa2778fea8aa7ed70d95e4","observation_id":"9b210cb0-f49a-48d1-aea4-6c6df8c36850","resolution":{"observed_at":"2026-08-06T15:40:16.538614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T15:40:16.600627Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.600627Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:dee8ba1e51e544ee25ed729412c7ce1d8c8b88437f99e0a99868c6aebb71bcea","observation_id":"58d43223-87e6-472e-b055-18d7a48a7cdb","resolution":{"observed_at":"2026-08-06T15:40:16.600627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.317341Z","title":"Mutual fund performance","venue":null,"work_id":"77b3e3e9-0e6d-4d40-baaf-424f69fab193","year":1966},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.680687Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:602e129cf01abf0a898802edb54ea96f68cb394a7fd95ff11d790be4820d7e32","observation_id":"98871c98-ad6d-461e-90d4-40083a555d8e","resolution":{"observed_at":"2026-08-06T15:40:19.401125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.751394Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.751394Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:0f1b5994cd967b276bd36f5b5e391d49f3381bd3a1daea245a96fb7ea2a0f329","observation_id":"a399d956-22d0-4734-b28b-5c7ad4a851cb","resolution":{"observed_at":"2026-08-06T15:40:16.751394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11239","last_updated":"2024-10-02T11:07:14Z","snapshot_observed_at":"2026-08-16T13:17:48.790274Z","submitted_at":"2024-09-17T14:40:02Z","title":"LLM-as-a-Judge & Reward Model: What They Can and Cannot Do","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11239","snapshot_observed_at":"2026-08-06T15:40:16.846785Z","title":"Llm-as-a-judge & reward model: What they can and cannot do, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.846785Z"},"links":{"cited_paper":"/paper/2409.11239","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:4c97b14a744df6cfe78a1c08dade94b3a89ebd35c8aecc9d1563dc3e2bb6125b","observation_id":"9aeebd62-11a7-44fa-94b3-9d09552a9746","resolution":{"observed_at":"2026-08-06T15:40:16.846785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.908542Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.908542Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:9ec8e97bad2d0098ae5879b44566d26eafa32bfd0934b6f8c4ec9e08218bf52c","observation_id":"cc34c0a9-eb6a-439b-851c-fc50b32b7883","resolution":{"observed_at":"2026-08-06T15:40:16.908542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:16.999910Z","title":"Policy gradient methods for reinforcement learning with function approximation","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:16.999910Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:761d8c874b299b0530902a49f8c7005d3b6ed3f4b359ed8ba8d8805c66958e80","observation_id":"362f149e-6940-42e8-8316-2a92bb0a8b50","resolution":{"observed_at":"2026-08-06T15:40:16.999910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03533","last_updated":"2023-11-06T21:14:40Z","snapshot_observed_at":"2026-08-16T14:45:30.599133Z","submitted_at":"2023-11-06T21:14:40Z","title":"Quantifying Uncertainty in Natural Language Explanations of Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.03533","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.03533","snapshot_observed_at":"2026-08-06T15:40:18.584627Z","title":"Quantifying Uncertainty in Natural Language Explanations of Large Language Models","venue":"cs.CL","work_id":"29d622c3-14d1-4804-8a56-66c8051a08f0","year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.037690Z"},"links":{"cited_paper":"/paper/2311.03533","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:9cf985f838848da0522f9b94bb97a1b4fcb440b9a189d1c891dc6ab5b7f56edc","observation_id":"b75730e9-da5d-469a-ad94-d67b210d359e","resolution":{"observed_at":"2026-08-06T15:40:18.689752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T15:40:17.125727Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.125727Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:ba5c13552d0e3dd13a6f2df1cb7a21da8f06928e55be86cd62947bcd9141f29f","observation_id":"99d1eca3-0d57-44c2-89f2-f0e50ca4e355","resolution":{"observed_at":"2026-08-06T15:40:17.125727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T15:40:17.194495Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.194495Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:f0544dfdcc75a115c09b1e706ea32a7cc9116fce11679bbb695d76d729c24a06","observation_id":"6b251672-a983-4cec-8bd6-84eb6017d14b","resolution":{"observed_at":"2026-08-06T15:40:17.194495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-06T15:40:17.315138Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.315138Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:928c83e171650f9221226e3b30a63e81fafe708f62d787a58c4e5f26cb71a86a","observation_id":"8d6d2705-1af5-4aef-a24c-771fdf608aa3","resolution":{"observed_at":"2026-08-06T15:40:17.315138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T15:40:17.350383Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.350383Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:88b4c82307c9de53525b3b9b500b339165b6906157fac6948f73bfe92279a3ec","observation_id":"4b7ec90c-cf1c-40a0-b378-fd8e214e9552","resolution":{"observed_at":"2026-08-06T15:40:17.350383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:17.443886Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.443886Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:aaaba84bcdb5caf501fcd1fc929fdf772383b8998ebcf50dc840149cdd7f30bb","observation_id":"98e4ed2e-64d5-47b2-b840-901b19b509cf","resolution":{"observed_at":"2026-08-06T15:40:17.443886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09528","last_updated":"2023-11-16T03:13:29Z","snapshot_observed_at":"2026-08-16T14:42:50.641609Z","submitted_at":"2023-11-16T03:13:29Z","title":"HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09528","snapshot_observed_at":"2026-08-06T15:40:17.507422Z","title":"Helpsteer: Multi-attribute helpfulness dataset for steerlm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.507422Z"},"links":{"cited_paper":"/paper/2311.09528","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:b7b8bfe75d61314bb067397df73b09f68bd1a2ead8a0a3df7f1bd51bc68f730f","observation_id":"c8a35bd8-9eeb-4310-b713-fbe3f304dbc7","resolution":{"observed_at":"2026-08-06T15:40:17.507422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:17.562762Z","title":null,"venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.562762Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:5edcd27322456f7ed54af9a0a1dbf81693ce70b95149d486a60c1a97a952d3c1","observation_id":"91d61d80-9a94-43c0-bbbd-640ab06fd754","resolution":{"observed_at":"2026-08-06T15:40:17.562762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:17.663383Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.663383Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:6873c0969061b250b9373805843c93bf369792a969d3e2ce2bd9c31bc6fc2720","observation_id":"d0847c30-0dc7-4bb2-b24e-876bd2a7af18","resolution":{"observed_at":"2026-08-06T15:40:17.663383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-08-15T10:58:51.256503Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-06T15:40:17.718260Z","title":"Can llms express their uncertainty? an empirical evaluation of confidence elicitation in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.718260Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:d255ac3d11836e247f4e056568069cc834832d15d5f318ba7b0a46955ce462f4","observation_id":"86902715-0dcf-4e6c-ac7e-5e21f4300593","resolution":{"observed_at":"2026-08-06T15:40:17.718260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:19.111937Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint","venue":null,"work_id":"44b55589-8dce-438c-9f50-2a7470e7091b","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.830385Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:abc3365bc8c5b73a5e6bae8b53f4d5c2fe0caf2007dfb35319284bdbcd793581","observation_id":"b9e8f8b0-26ef-4a1d-ab22-ede3d8ba02d1","resolution":{"observed_at":"2026-08-06T15:40:19.197653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T15:40:17.864241Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.864241Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:c088dfe369c4b26a7a03f7d62cb8654e50dec4e9781b59efcc71bb1c7996923c","observation_id":"9624b5bf-a1d1-4fa5-8d09-f4b118e216e4","resolution":{"observed_at":"2026-08-06T15:40:17.864241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-16T14:04:14.552299Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-06T15:40:17.967384Z","title":"Advancing llm reasoning generalists with preference trees","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:17.967384Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:01513fea1631286d304fa43c20095f0dbf595b53bfbd40fd73982963c869111b","observation_id":"a0780e28-bddc-4838-9500-e3b1140c06a7","resolution":{"observed_at":"2026-08-06T15:40:17.967384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00243","last_updated":"2023-12-30T14:14:14Z","snapshot_observed_at":"2026-08-16T14:30:45.268286Z","submitted_at":"2023-12-30T14:14:14Z","title":"Uncertainty-Penalized Reinforcement Learning from Human Feedback with Diverse Reward LoRA Ensembles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00243","snapshot_observed_at":"2026-08-06T15:40:18.065331Z","title":"Uncertainty-penalized reinforcement learning from human feedback with diverse reward lora ensembles","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.065331Z"},"links":{"cited_paper":"/paper/2401.00243","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:42ccb8c09b29d0cbd8aa7ac16bc8bcc9ce9fc2ee1d121fdf99623e1b8b0bda80","observation_id":"07acfe67-c226-46b8-9be1-2d768943a270","resolution":{"observed_at":"2026-08-06T15:40:18.065331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:18.924083Z","title":"Bayesian prompt ensembles: Model uncertainty estimation for black-box large language models","venue":null,"work_id":"dcd9e6e8-36be-443c-9deb-f8df3c64fd3d","year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.152809Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:967cb6c75073d8d7489054fdc9c5b7bebb64a587b25fd60474135a5a6ac0c0b9","observation_id":"1cc00e7e-3488-4566-9cd4-acba6e84c90a","resolution":{"observed_at":"2026-08-06T15:40:18.999138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16635","last_updated":"2024-10-22T06:19:20Z","snapshot_observed_at":"2026-08-16T14:23:26.502705Z","submitted_at":"2024-01-30T00:17:37Z","title":"Improving Reinforcement Learning from Human Feedback with Efficient Reward Model Ensemble","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16635","snapshot_observed_at":"2026-08-06T15:40:18.178863Z","title":"Improving reinforcement learning from human feedback with efficient reward model ensemble","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.178863Z"},"links":{"cited_paper":"/paper/2401.16635","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:63b0dfad9eee9e102a1f1cfce5ac90ab668b492967927e9f6482010aae381296","observation_id":"ac20c0ed-0aa3-4bb5-bf93-3e9d82819382","resolution":{"observed_at":"2026-08-06T15:40:18.178863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:18.225082Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.225082Z"},"links":{"citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:913297c37f55a35ae9d9bec51054f63e3bbd0a4158701e821ad29a9aedc7fe28","observation_id":"5790b6ad-18f7-4d2b-96cb-4127ecc14bb7","resolution":{"observed_at":"2026-08-06T15:40:18.225082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-06T15:40:18.315140Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:18.315140Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:ae1825c035b1fe59216d59b0827af4598415f908234a0af039383c95a9b1a2e3","observation_id":"6d9b15d1-25f5-428b-b2c2-6e41fc92c2a5","resolution":{"observed_at":"2026-08-06T15:40:18.315140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T09:18:36.811901Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2507.15906."}