{"as_of":"2026-08-16T01:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7132f6bfc6b3791048b058eae5093c7342d0236187cd79ff3eb04971b278932","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:21:58.815824Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:52:19.102106Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T08:31:16.863245Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08266","snapshot_observed_at":"2026-08-04T14:52:19.102106Z","title":"Chittepu, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-13T17:55:16.315847Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.102106Z"},"links":{"cited_paper":"/paper/2506.08266","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:bd90b86b02ee5fe5ecad2d35e3e5ca808582960362e7e62929d2b0e6ebe24ffe","observation_id":"32637181-00ce-4796-a516-eaa778829233","resolution":{"observed_at":"2026-08-04T14:52:19.102106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"cited_work":{"arxiv_id":"2506.08266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.08266 , year=","venue":null,"work_id":"57d0ae6a-3e99-4af2-a41a-ef89b68d1d16","year":2025},"citing_paper":{"arxiv_id":"2604.02507","last_updated":"2026-04-02T21:04:17Z","snapshot_observed_at":"2026-08-11T17:04:44.184917Z","submitted_at":"2026-04-02T21:04:17Z","title":"Reinforcement Learning from Human Feedback: A Statistical Perspective","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T20:10:43.578904Z"},"links":{"cited_paper":"/paper/2506.08266","citing_paper":"/paper/2604.02507"},"observation_digest":"sha256:3dc3e4bac1fd0c3c3d94940cad9b6980169ce1643ab558a7d0e9acd4ab83393d","observation_id":"1437125e-c3ed-4c8c-85f0-a701b5c4ff4e","resolution":{"observed_at":"2026-05-13T20:13:13.609624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"cited_work":{"arxiv_id":"2506.08266","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08266","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.08266 , year=","venue":null,"work_id":"57d0ae6a-3e99-4af2-a41a-ef89b68d1d16","year":2025},"citing_paper":{"arxiv_id":"2605.21822","last_updated":"2026-05-20T23:44:06Z","snapshot_observed_at":"2026-08-12T17:48:15.828969Z","submitted_at":"2026-05-20T23:44:06Z","title":"Implicit Safety Alignment from Crowd Preferences","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-22T08:28:41.652865Z"},"links":{"cited_paper":"/paper/2506.08266","citing_paper":"/paper/2605.21822"},"observation_digest":"sha256:4258f07531ec0f0af82b6a5cf276fb675ecc2db024624bb5597404215143702f","observation_id":"8345e638-7f56-407a-8140-7d5adc8af28e","resolution":{"observed_at":"2026-05-22T08:31:16.865653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08266/citation-record","integrity":"/paper/2506.08266/integrity","json":"/paper/2506.08266/citation-record.json","paper":"/paper/2506.08266"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T05:21:58.599591Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in LLMs , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.599591Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:6b3920cfdd0f617e3c2f2b10a342c4553ea9b54fcc1e9df59616b1a239db8efc","observation_id":"56377b31-6649-45fe-88dc-a8000252c936","resolution":{"observed_at":"2026-08-07T05:21:58.599591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.604175Z","title":"Constrained Markov decision processes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.604175Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:731d366a6a2bf3af9973fa5d269c2383c5bba9cb337d928acb892090b44a22c5","observation_id":"1d856b60-19ac-4048-827b-1bafa03f8893","resolution":{"observed_at":"2026-08-07T05:21:58.604175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T05:21:58.608048Z","title":"Constitutional AI : Harmlessness from AI feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.608048Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:2cca460e0b6274bb79aa4a87bc6d60ad4f836456fd0a5083112926366039a6d5","observation_id":"d6aa3d0b-ca63-4b80-8d0d-c16bd0df323a","resolution":{"observed_at":"2026-08-07T05:21:58.608048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:21:58.612077Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.612077Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:afcb9514f6d0513211d1eefa4f0e9ee9da46819d8a4b12c5f9d580f98990c8e3","observation_id":"fbe55287-cb2e-4b07-84f9-2299ce6ab95d","resolution":{"observed_at":"2026-08-07T05:21:58.612077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.615943Z","title":"Convex optimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.615943Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:76093194395452d0427aca4095a653f21d8c55405ba8c974870be5f4ecdd5a26","observation_id":"c12c71ee-0016-4ee0-9047-9f03ee6fe616","resolution":{"observed_at":"2026-08-07T05:21:58.615943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.516795Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"592b6563-a7bd-4c7e-8fdc-10cdbe0c60e5","year":1952},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.619931Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:1826b5d89f135cf6c7c81c5635a3754437c4e9288ac6519d862072f99aed40d9","observation_id":"d59d16e5-e0a7-46dc-a0cb-a7bed72ca393","resolution":{"observed_at":"2026-08-07T05:21:59.520895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03741","last_updated":"2023-02-17T17:00:34Z","snapshot_observed_at":"2026-08-12T12:29:44.507445Z","submitted_at":"2017-06-12T17:23:59Z","title":"Deep reinforcement learning from human preferences","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03741","snapshot_observed_at":"2026-08-07T05:21:58.624040Z","title":"Brown, Miljan Martic, Shane Legg, and Dario Amodei","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.624040Z"},"links":{"cited_paper":"/paper/1706.03741","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:aacb452246593f4d9ef29fe4434d12dd2e58787a211995ce4f76b170c06481d1","observation_id":"f2e01823-14fb-4cb4-b533-7bcffd74649e","resolution":{"observed_at":"2026-08-07T05:21:58.624040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-14T19:10:00.850271Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-07T05:21:58.628042Z","title":"Safe RLHF : Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.628042Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:b942025a51bf1bf5118b38746f103e3edf940af50731dce161a996b602ed5324","observation_id":"43af2ee8-fb62-4003-a3d9-36fbd6627858","resolution":{"observed_at":"2026-08-07T05:21:58.628042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1206.6404","last_updated":"2012-06-27T19:59:59Z","snapshot_observed_at":"2026-08-15T00:55:10.848929Z","submitted_at":"2012-06-27T19:59:59Z","title":"Policy Gradients with Variance Related Risk Criteria","version":1},"cited_work":{"arxiv_id":"1206.6404","doi":null,"metadata_source":"pith","pith_arxiv_id":"1206.6404","snapshot_observed_at":"2026-08-07T05:21:59.221743Z","title":"Policy Gradients with Variance Related Risk Criteria","venue":"cs.LG","work_id":"21d46410-cd45-470d-ab5e-2342fbad5b04","year":2012},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.631826Z"},"links":{"cited_paper":"/paper/1206.6404","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:a25c2c700b86ce7ce6e1f9cbafeca01ea072dccec21b602d7480e11ce101027b","observation_id":"d0462d37-6aa5-49ff-b43f-4347a7448210","resolution":{"observed_at":"2026-08-07T05:21:59.225698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03451","last_updated":"2021-07-23T15:05:22Z","snapshot_observed_at":"2026-08-13T18:49:54.260222Z","submitted_at":"2021-07-07T19:25:57Z","title":"Anticipating Safety Issues in E2E Conversational AI: Framework and Tooling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03451","snapshot_observed_at":"2026-08-07T05:21:58.636063Z","title":"Stevie Bergman, Shannon Spruit, Dirk Hovy, Y-Lan Boureau, and Verena Rieser","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.636063Z"},"links":{"cited_paper":"/paper/2107.03451","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:ff70fd12bc05923bd6dd65348d291ccb896859bc5417fa8a744ada3ab60b58c4","observation_id":"e182abdc-9e22-47b8-9852-ac3d6f0eb28d","resolution":{"observed_at":"2026-08-07T05:21:58.636063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14387","last_updated":"2024-01-08T04:46:56Z","snapshot_observed_at":"2026-08-13T11:36:59.381257Z","submitted_at":"2023-05-22T17:55:50Z","title":"AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14387","snapshot_observed_at":"2026-08-07T05:21:58.639987Z","title":"Hashimoto","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.639987Z"},"links":{"cited_paper":"/paper/2305.14387","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:0c80ba34847294943f4408f342c7f45c8bbddd36f3d3dbd8f36c09ee24e0b819","observation_id":"e8c042f1-7573-493f-aac2-c9a443c337f4","resolution":{"observed_at":"2026-08-07T05:21:58.639987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.505300Z","title":"Fundamentals of optimization theory with applications to machine learning","venue":null,"work_id":"cb2869a7-2e7f-44d8-949e-f0bc441b1289","year":2019},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.643947Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:c906840c75e595f67d2602bdb6d5c5ff97a10afb8fd3d2b8b02ec08808c78580","observation_id":"2f07684d-8a34-45e2-9aaa-acf16bc1838d","resolution":{"observed_at":"2026-08-07T05:21:59.509176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-08-13T10:17:00.791443Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-07T05:21:58.647177Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.647177Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:542df35631980b64ec1771b470f1a8a818fbdb20b2b87eedff15a96ac7816998","observation_id":"16df702a-b512-4412-854f-3cd7bae3fe74","resolution":{"observed_at":"2026-08-07T05:21:58.647177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.494250Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"26883cb7-035f-4e75-aea5-f59a5f782d34","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.650410Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:a4225148c683304565745b63987f27356e6e1eacdd006e38b5e7af36d8c00691","observation_id":"3268aad4-55be-4c92-9fa7-318e0e010cf5","resolution":{"observed_at":"2026-08-07T05:21:59.497961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.482378Z","title":null,"venue":null,"work_id":"690d321c-33c0-41d7-9852-723aeaf182db","year":2020},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.653546Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:120ff646dfed28692a3cf18cce845cc1ed728ad79dbe3b21e0c96c069cd08690","observation_id":"94183662-19cc-44e8-b867-3065a1951642","resolution":{"observed_at":"2026-08-07T05:21:59.485906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.471274Z","title":"Fairness guarantees under demographic shift","venue":null,"work_id":"14199629-b6db-425c-82d8-80cf9704402c","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.659981Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:a889a835fb06f24c9c74aca31319e3f21b3d3e977055de2a25363cf071c15fef","observation_id":"adafa1f0-2f03-4377-afbc-cc0c6935a6eb","resolution":{"observed_at":"2026-08-07T05:21:59.475161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-08-11T23:28:54.309888Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-07T05:21:58.668478Z","title":"Improving alignment of dialogue agents via targeted human judgements, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.668478Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:3b847bc74a0df2da808dc333203ae6500debe89e287756c7a79352175f955a76","observation_id":"fb60a32b-e206-4001-9b95-87797be7d16a","resolution":{"observed_at":"2026-08-07T05:21:58.668478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:21:58.671965Z","title":"The Llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.671965Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:16fac7af8181b7d7e2ce5aad73429063437ddd7eb2732d1fbef586d847805806","observation_id":"b4fca4c5-6a67-46c0-8bf4-05c628320eea","resolution":{"observed_at":"2026-08-07T05:21:58.671965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09050","last_updated":"2017-11-24T17:14:34Z","snapshot_observed_at":"2026-08-14T20:10:24.531978Z","submitted_at":"2017-11-24T17:14:34Z","title":"Ethical Challenges in Data-Driven Dialogue Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09050","snapshot_observed_at":"2026-08-07T05:21:58.675367Z","title":"Ethical challenges in data-driven dialogue systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.675367Z"},"links":{"cited_paper":"/paper/1711.09050","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:82ab3265dfb9f786f3469cf6a408732b52c5ee0cffa8ccea41dd3963c742f039","observation_id":"df3cfe86-df38-4464-b643-b1f6920c81ed","resolution":{"observed_at":"2026-08-07T05:21:58.675367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.679396Z","title":"Probability inequalities for sums of bounded random variables","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.679396Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:fd69418ad8f54420d68792b264dd974f74ed063924408dbdf0ddcc7a7a5ebd41","observation_id":"d3b9665f-e183-41e6-9990-aaf7b1ae7336","resolution":{"observed_at":"2026-08-07T05:21:58.679396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.452592Z","title":"One-shot safety alignment for large language models via optimal dualization","venue":null,"work_id":"63756f8b-d3cb-4a4d-b05a-5eedbaf2978f","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.682720Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:ec099bf535f29205f5df71ce6f7da7170728e955986f3d808ec81bb6ce50d9f0","observation_id":"5bf73396-d333-484c-8515-8a597fe4ae00","resolution":{"observed_at":"2026-08-07T05:21:59.456542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-08-14T02:56:45.044088Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-07T05:21:58.685785Z","title":"Jones, Shixiang Shane Gu, and Rosalind W","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.685785Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:52f6077e6cd3ecc6e981d74a358e58fa3c5e774f2e80f141b3e73527534f82b2","observation_id":"085d504c-bea5-441e-8287-5688ca3b64fa","resolution":{"observed_at":"2026-08-07T05:21:58.685785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.689205Z","title":"Beavertails: Towards improved safety alignment of LLM via a human-preference dataset, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.689205Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:ba2ce242fdd6b0f4276c6eddd7105d31d9fdc1e5344ce1adfa2bff324f3a2049","observation_id":"4b85f2f4-dc88-4f8d-a4d0-1933183454bd","resolution":{"observed_at":"2026-08-07T05:21:58.689205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.440866Z","title":"ChatGPT for good? O n opportunities and challenges of large language models for education","venue":null,"work_id":"10ad2070-aa5a-4342-8c0a-6109325561b7","year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.692927Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:d2ae6af3efea350008980bc2a2095208afe8bcecc06e4f9fb70b55452416a8c4","observation_id":"3a4a982a-e92c-4f25-8552-7c6e80c6392b","resolution":{"observed_at":"2026-08-07T05:21:59.444817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.428091Z","title":"GPT -4 passes the bar exam","venue":null,"work_id":"5a6ef3b2-61d6-4cac-9acc-582fe264a81a","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.696131Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:7334bf33cb4c9a494a87cacb70f03a860beab4c770108c9135ebcd0d33eb80b5","observation_id":"78efc2c2-f73b-463f-bdd9-560b19c3c745","resolution":{"observed_at":"2026-08-07T05:21:59.432588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.699651Z","title":"Buy 4 reinforce samples, get a baseline for free! In DeepRLStructPred@ICLR, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.699651Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:15656ac8ed9bb0bded1fd09ef6ddd36e2d3c7720f00766666920d1386f61b869","observation_id":"a9a7b0f8-a552-4b74-bd8c-f14dc96d2620","resolution":{"observed_at":"2026-08-07T05:21:58.699651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.409839Z","title":"Kung, Morgan Cheatham, Arielle Medenilla, Czarina Sillos, Lorie De Leon, Camille Elepa \\ n o, Maria Madriaga, Rimel Aggabao, Giezel Diaz-Candido, James Maningo, and Victor Tseng","venue":null,"work_id":"6d97c3af-6240-4720-9922-52e242c13b95","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.703396Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:1ec3dfcf2fd5b51cd57d9c8e6fc2846b3bf61642c95cb1df0fe2e546a9e1e18e","observation_id":"31cb7100-2d54-4f7c-bc55-069b11578069","resolution":{"observed_at":"2026-08-07T05:21:59.413594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02475","last_updated":"2024-03-04T20:39:24Z","snapshot_observed_at":"2026-08-13T04:03:36.032114Z","submitted_at":"2024-03-04T20:39:24Z","title":"Enhancing LLM Safety via Constrained Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02475","snapshot_observed_at":"2026-08-07T05:21:58.706600Z","title":"Enhancing llm safety via constrained direct preference optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.706600Z"},"links":{"cited_paper":"/paper/2403.02475","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:a5f524becaf6971a6c919c7929347bca1b79ff1f8abd0e6d34b1b1b812296fab","observation_id":"094a5a8d-af98-4b91-83a0-bad6ed9f6a95","resolution":{"observed_at":"2026-08-07T05:21:58.706600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.397360Z","title":"Offline contextual bandits with high probability fairness guarantees","venue":null,"work_id":"cc6bb730-b0be-4d5c-878b-a0d84d1e8b3d","year":2019},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.710273Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:fc6f27275522e374ae1d22f9205902dbbffed643fbfe22856829b72f1653ae56","observation_id":"00e2e0a5-26c9-4697-956f-4b4fb406a4e0","resolution":{"observed_at":"2026-08-07T05:21:59.401561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.386119Z","title":"Krumholz, Jure Leskovec, Eric J","venue":null,"work_id":"b063e9de-17cb-40f7-b47d-25fdbfc89eb2","year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.713452Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:0a55d6df258e94bd3334db91abec56fb8665bc367b85817808d699009b908fc8","observation_id":"fc679d97-1a53-4ad8-b491-8692792fbc38","resolution":{"observed_at":"2026-08-07T05:21:59.389891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.374933Z","title":"Rule based rewards for language model safety","venue":null,"work_id":"0a36fd5b-3b3c-4a86-84dd-9a9d65cdb647","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.716656Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:7c49f15e8de8c51cc3a7ea9948df382ab294ecbfb3a1f46be4348ca903145cc3","observation_id":"bce4a920-bc4e-44b7-b7fd-fb5af4712eee","resolution":{"observed_at":"2026-08-07T05:21:59.379311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T05:21:58.720364Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.720364Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:c33bb077b177d6b94f38ed866d137393dd207d06311c722d225c92ad867b6d60","observation_id":"ce0cb1d9-f734-47cb-b6ed-741e6ad2addd","resolution":{"observed_at":"2026-08-07T05:21:58.720364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19933","last_updated":"2025-02-27T07:28:35Z","snapshot_observed_at":"2026-08-12T22:14:55.185904Z","submitted_at":"2024-10-25T19:08:23Z","title":"Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization","version":2},"cited_work":{"arxiv_id":"2410.19933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.19933","snapshot_observed_at":"2026-08-07T05:21:59.022598Z","title":"Enhancing Safety in Reinforcement Learning with Human Feedback via Rectified Policy Optimization","venue":"cs.LG","work_id":"3b0bc07a-a5eb-4206-b258-70a0a37531ab","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.724147Z"},"links":{"cited_paper":"/paper/2410.19933","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:6f9a085255541ec678a4752a24ae09c8d4a1a57166066d790cc458acd3cf9dc6","observation_id":"08ef3aa0-5ad6-4b8b-a146-bd0f8c20961f","resolution":{"observed_at":"2026-08-07T05:21:59.026775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T05:21:58.727951Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.727951Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:c05e7c97aaced9bbdc8fc457334fe8ad8d7b4a0bf5416f3be88b52df179ff0da","observation_id":"f5776140-9477-4cb4-93ed-fd1f3ff2abba","resolution":{"observed_at":"2026-08-07T05:21:58.727951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T05:21:58.731769Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.731769Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:05a8566dfb0df8edb131e1978f3ab7de6b372598282be76aff585325ff116f35","observation_id":"6dba9141-8a58-4692-a9b2-e1d3b097c395","resolution":{"observed_at":"2026-08-07T05:21:58.731769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-08-15T10:00:21.714734Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-07T05:21:58.735489Z","title":"Sikchi, Joey Hejna, Bradley Knox, Chelsea Finn, and Scott Niekum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.735489Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:03872632886c7089fddca91879c59623e9c2addf2ab78de81abe1bc6853704e9","observation_id":"14082912-204e-42f1-be50-db845eab2700","resolution":{"observed_at":"2026-08-07T05:21:58.735489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.363319Z","title":"Rewarded soups: towards pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards","venue":null,"work_id":"0a7133f1-c2a7-4480-a9e1-0c8970207a00","year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.739826Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:4387dd810b37674ffc6fae5f772dc7af56c1679370b88895fc09bb931cfd3a90","observation_id":"681def66-995e-4f7e-b389-928d39c912c2","resolution":{"observed_at":"2026-08-07T05:21:59.367354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.352355Z","title":"Simultaneous statistical inference","venue":null,"work_id":"814f02c2-a751-422c-b992-72135bde9543","year":2012},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.743188Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:0734b69cdc40f90167820410911729e50bace87a57291e051b4f825aa2d08422","observation_id":"feb3e995-1e75-40f7-870f-c1a9fbca64fb","resolution":{"observed_at":"2026-08-07T05:21:59.356121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:21:58.746310Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.746310Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:0827a6a5cd4f5bb23989264fd9bdb835ceeea2d60991614193f43e1e1b4e8c14","observation_id":"5fcea960-3005-4e63-bfb7-1b218532842a","resolution":{"observed_at":"2026-08-07T05:21:58.746310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-12T00:02:16.697336Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-07T05:21:58.749826Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.749826Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:dad9251a6dcea37bedee98d672b25b4c749ecbcf042fdb460a98ac5f25c65833","observation_id":"0425a0d8-0177-4019-85af-d75be4267884","resolution":{"observed_at":"2026-08-07T05:21:58.749826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.341161Z","title":"The probable error of a mean","venue":null,"work_id":"ede8b247-a754-4f3f-b88e-1d1c447d37a6","year":1908},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.753669Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:24f9355853c4e2b878e6e9c0994bfb20a5b4466e1167006652972c5d534352d3","observation_id":"449cef09-448b-4918-8f7b-1c2c972aa1c0","resolution":{"observed_at":"2026-08-07T05:21:59.345555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11555","last_updated":"2025-02-17T08:40:30Z","snapshot_observed_at":"2026-08-07T18:13:19.634959Z","submitted_at":"2025-02-17T08:40:30Z","title":"Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11555","snapshot_observed_at":"2026-08-07T05:21:58.756875Z","title":"Equilibrate RLHF : Towards balancing helpfulness-safety trade-off in large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.756875Z"},"links":{"cited_paper":"/paper/2502.11555","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:128a82329793fe2072c83904c051ff6fd4207864fc9e4d30bd433aec1f846cac","observation_id":"7de895b4-008b-4581-abd2-f98f8bea42bc","resolution":{"observed_at":"2026-08-07T05:21:58.756875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.760319Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.760319Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:35b3730fad05a09ca920f97509ad11d18a9e00b1bde74537944c495cc8567d33","observation_id":"5fc9254e-270a-4133-9587-da6866bd2b74","resolution":{"observed_at":"2026-08-07T05:21:58.760319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.323874Z","title":"Preventing undesirable behavior of intelligent machines","venue":null,"work_id":"04c6cc69-d7b8-4562-94bb-63e179a054df","year":2019},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.763641Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:7551464076749b5881a39fef5e1a1924c4d0965a0833a54aa11def6db3bd4f57","observation_id":"d515259b-92f9-4ecb-b751-de47abce81f2","resolution":{"observed_at":"2026-08-07T05:21:59.327648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-08-07T05:21:58.767276Z","title":"Lamda: Language models for dialog applications, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.767276Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:b1e036e72d25b171972f7f3049772277194350e49d6172cd4c57923b35c4c578","observation_id":"64dc4375-c341-49e2-8d1f-aa55230916cd","resolution":{"observed_at":"2026-08-07T05:21:58.767276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T05:21:58.770901Z","title":"LlaMa 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.770901Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:644d6b6c1a3e3b5d1bd1e8778017458dc96c6d3ab97b7a7e6d98f5a9a6e5d66d","observation_id":"c6401466-52e9-49e9-8e0b-1907d3b73769","resolution":{"observed_at":"2026-08-07T05:21:58.770901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.312446Z","title":"Tran, Rei Sato, Takumi Tanabe, and Youhei Akimoto","venue":null,"work_id":"2f9ce317-e20c-4770-b6d0-7ddb3d3416a6","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.774310Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:701cce6ec88f78d02a234aaa85904fb312730927da7cffca2c8c089efced1483","observation_id":"ce9dc7c0-7761-480a-a53a-8b110137fd31","resolution":{"observed_at":"2026-08-07T05:21:59.316321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11744","last_updated":"2022-08-24T19:14:56Z","snapshot_observed_at":"2026-08-13T14:39:27.292122Z","submitted_at":"2022-08-24T19:14:56Z","title":"Enforcing Delayed-Impact Fairness Guarantees","version":1},"cited_work":{"arxiv_id":"2208.11744","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.11744","snapshot_observed_at":"2026-08-07T05:21:58.928821Z","title":"Enforcing Delayed-Impact Fairness Guarantees","venue":"cs.LG","work_id":"af2b4996-df42-4530-b709-d7208ec13829","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.778283Z"},"links":{"cited_paper":"/paper/2208.11744","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:fa9700bbf3ff394b3fafcb7b5cdae558fb12102138bf9db8a7f4a5e296def258","observation_id":"46904a93-d126-448b-ac6c-959027d47ce8","resolution":{"observed_at":"2026-08-07T05:21:58.932492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-07T05:21:58.781959Z","title":"Ethical and social risks of harm from language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.781959Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:1885067a3afa4f020999bf809b74f396cf9ac7fddae1270e1aa186347df1486e","observation_id":"5b6357af-c971-41de-9d6a-10a85f23d23e","resolution":{"observed_at":"2026-08-07T05:21:58.781959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.785508Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.785508Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:538bf2c3405eb6ca539b9cd7b7f01c2a3ed1f339fcb1fdc36464463212c98bde","observation_id":"367a0044-733d-4030-86de-d0ac856dc876","resolution":{"observed_at":"2026-08-07T05:21:58.785508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07079","last_updated":"2021-08-04T21:33:39Z","snapshot_observed_at":"2026-08-06T19:00:21.027890Z","submitted_at":"2020-10-14T13:26:39Z","title":"Recipes for Safety in Open-domain Chatbots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07079","snapshot_observed_at":"2026-08-07T05:21:58.788856Z","title":"Recipes for safety in open-domain chatbots, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.788856Z"},"links":{"cited_paper":"/paper/2010.07079","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:e8801a3b9b28cfe721be3398d17a7d8557826c7389d020e10e60aa7e7964764b","observation_id":"17688df0-e3b8-42e0-91ee-ffcc0610464f","resolution":{"observed_at":"2026-08-07T05:21:58.788856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:21:58.792512Z","title":"Qwen2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.792512Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:b244223a1e8009ecda8a9a20289e7c4d51682b4c390544d9b82d469b262818be","observation_id":"215d5810-a9fe-434f-b1cf-63c3a55c3b00","resolution":{"observed_at":"2026-08-07T05:21:58.792512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:59.293414Z","title":"A large language model for electronic health records","venue":null,"work_id":"3ec39c4b-484e-4779-9741-49ab1852cdfd","year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.796231Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:a06d5d0fe7daf219c1736187ee40e8470629f279467615bc66ad378309fcd9e4","observation_id":"3e7ecda3-d383-418a-9fd8-e16ffa389a83","resolution":{"observed_at":"2026-08-07T05:21:59.298310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15313","last_updated":"2025-04-08T11:04:33Z","snapshot_observed_at":"2026-08-14T17:13:23.544871Z","submitted_at":"2024-08-27T17:31:21Z","title":"Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models","version":2},"cited_work":{"arxiv_id":"2408.15313","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15313","snapshot_observed_at":"2026-08-07T05:21:58.879423Z","title":"Bi-Factorial Preference Optimization: Balancing Safety-Helpfulness in Language Models","venue":"cs.AI","work_id":"f54b8ab8-6ac2-40d4-9905-58efe3cb3e81","year":2024},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.799911Z"},"links":{"cited_paper":"/paper/2408.15313","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:580bf44096fbfc9efdfa1e9d2126e7b1c7c0375c2974b7dbdfad129f7756a191","observation_id":"f8037334-eadc-4a1f-8d46-ec3f0acf2601","resolution":{"observed_at":"2026-08-07T05:21:58.886951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-07T05:21:58.803923Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.803923Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:ac46e751946860fe23ff55119f3df72f805e785d19bb687d0523bd4ba98e7cef","observation_id":"373be2dd-3351-4c21-85a9-93d010d415bf","resolution":{"observed_at":"2026-08-07T05:21:58.803923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-08-07T18:08:01.409989Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04964","snapshot_observed_at":"2026-08-07T05:21:58.808116Z","title":"Secrets of RLHF in large language models part I : PPO","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.808116Z"},"links":{"cited_paper":"/paper/2307.04964","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:f5aa96ab73b1382a0866d58e46f6293c0282f263aa0a67479571df7cf779d489","observation_id":"4e532ecc-f56f-4b18-b185-9ca210e2b8c5","resolution":{"observed_at":"2026-08-07T05:21:58.808116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01663","last_updated":"2022-11-10T01:02:29Z","snapshot_observed_at":"2026-08-13T15:50:40.019275Z","submitted_at":"2022-05-03T17:50:06Z","title":"Adversarial Training for High-Stakes Reliability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01663","snapshot_observed_at":"2026-08-07T05:21:58.812008Z","title":"Ziegler, Seraphina Nix, Lawrence Chan, Tim Bauman, Peter Schmidt-Nielsen, Tao Lin, Adam Scherlis, Noa Nabeshima, Ben Weinstein-Raun, Daniel de Haas, Buck Shlegeris, and Nate Thomas","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.812008Z"},"links":{"cited_paper":"/paper/2205.01663","citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:6d402da9a11c4e6387f1305c99f0d08f9f8c05d054b80fc5b0b39a94138a1907","observation_id":"8ba6c1c8-f416-430f-a4e4-1450569e1f9a","resolution":{"observed_at":"2026-08-07T05:21:58.812008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:21:58.815824Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T05:21:58.815824Z"},"links":{"citing_paper":"/paper/2506.08266"},"observation_digest":"sha256:9aa9b8ff9634c16db27896b82b6a3f4aa8f5deba1c2051b613730edd5af5f4ec","observation_id":"f98a0e96-415d-4e86-9bf3-5e8cacb70470","resolution":{"observed_at":"2026-08-07T05:21:58.815824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T07:39:53.450441Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":4,"verified_fuzzy":17},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 3 inbound Pith citation observations for arXiv:2506.08266."}