{"as_of":"2026-08-22T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74ddebc8602b20b9a457e00843fa0f93d09f06a0089d20fd797df6435a9401e8","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:46.948522Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15011/citation-record","integrity":"/paper/2505.15011/integrity","json":"/paper/2505.15011/citation-record.json","paper":"/paper/2505.15011"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:50.002718Z","title":null,"venue":null,"work_id":"4ce55ffc-025c-42ac-9cb4-b0c55a227a5f","year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:43.685469Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:6e8db4000edab62a4bbecc52b7199a202cabcd77a8282517efb48df3c063136d","observation_id":"f2332345-46e5-4552-bc79-0810f28a4cfc","resolution":{"observed_at":"2026-08-07T15:29:50.068590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10676-006-0004-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:03:40.895421Z","title":null,"venue":"Ethics and Information Technology","work_id":"b713a6f7-673c-4920-a878-cee27e6b9920","year":2005},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:43.728897Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:3f922d2bf4b03fb0d29ebaad0c20ee2b7da65c9ef34e1a149137990b2e3255b9","observation_id":"92fa9ca6-4ed9-4ec6-96f3-23a674c10e81","resolution":{"observed_at":"2026-08-07T15:29:47.879679Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.938013Z","title":null,"venue":null,"work_id":"3aa3a279-9056-4e6f-a136-3186fe3a0374","year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:43.806848Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:d13b7e9da8801305ed1044c2c52f946a046b8fc6278cf5bc2a22a150b6609b84","observation_id":"e9adfc80-a04d-4a0a-b6eb-05e92ec58a40","resolution":{"observed_at":"2026-08-07T15:29:49.965780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:43.877217Z","title":"2011.Machine Ethics","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:43.877217Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:55c059ab57c3b1d8e2e9edc623ae987f90c4967c208a5f1d7d4d8aab0711c93b","observation_id":"b63afe19-0577-4c95-b520-50dbdd65545d","resolution":{"observed_at":"2026-08-07T15:29:43.877217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-023-06311-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:03:40.895421Z","title":null,"venue":"Machine Learning","work_id":"f411f93c-5aec-420c-86ba-bcde58122688","year":2023},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.051349Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:d9640682823e7c924aecabba0f74850840e2b146341c02bc68986f4241f4c913","observation_id":"27251b20-f90f-4d83-99ab-cf5909d59cde","resolution":{"observed_at":"2026-08-07T15:29:47.757610Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.850955Z","title":null,"venue":null,"work_id":"129e7c02-a664-49fd-8808-1400927fa0b7","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.103805Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:1f18e197a93ffa9b2680aab57c0a7c81206d2c72b5b5868cae692e0b50c1faa8","observation_id":"5d31ef8c-32c7-4f81-bebc-032c5f01fb53","resolution":{"observed_at":"2026-08-07T15:29:49.885469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.793486Z","title":null,"venue":null,"work_id":"4114dca6-150c-4289-9d81-f67d2022afbb","year":2023},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.273364Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:2fff989faec54c26ec72069fbc5161abbd9e572240768fcf1e484bd098fff7b1","observation_id":"d1ed2666-4d6f-4b88-a99b-c05226295133","resolution":{"observed_at":"2026-08-07T15:29:49.819983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.10295","last_updated":"2019-07-09T09:57:23Z","snapshot_observed_at":"2026-08-16T02:29:41.156593Z","submitted_at":"2017-06-30T17:56:19Z","title":"Noisy Networks for Exploration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.10295","snapshot_observed_at":"2026-08-07T15:29:44.411449Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.411449Z"},"links":{"cited_paper":"/paper/1706.10295","citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:495f7849e765b616d3591b19c1fa5aa939aa73171b1863885bb3bc8f98041c2f","observation_id":"7c782612-e9c2-4935-8399-85d73ef4f1c9","resolution":{"observed_at":"2026-08-07T15:29:44.411449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:44.541245Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.541245Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:e2ff78b9003e5f33ae40279fcbfb3ace75cc9b4145f93fcc3c4e97fa2c71bf51","observation_id":"548e27e1-1903-42a6-8b79-686afb662f1d","resolution":{"observed_at":"2026-08-07T15:29:44.541245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v32i1.11295","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"c4191b5e-aa6b-4870-affa-17a0693b4c43","year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.813018Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:4937a947f6e51fe0769bb95898ddb7f85f6ec9eaf3d667bd867f4abf2c96fbb6","observation_id":"1b5c38e4-c5c3-4d5f-8325-3b2da96af338","resolution":{"observed_at":"2026-08-07T15:29:47.598569Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.716171Z","title":null,"venue":null,"work_id":"adebd2a8-daff-44d5-a6e9-85f8f29ff156","year":2021},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.931454Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:e3bb67bc3e6f3d216931072a7e37750bbffba4596c0c7888ff9f3ae4aecc1d3c","observation_id":"6bf8f9d4-7852-479b-aa0d-da8c51ca34b9","resolution":{"observed_at":"2026-08-07T15:29:49.746484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.635348Z","title":"Hauptabt","venue":null,"work_id":"6b52c178-0ede-4d94-aa3d-7ded8e5d9a78","year":1998},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.058627Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:d0dad9be039a1007ba3bbfbd052e319c5ff4a45e85a661c5d259454e881adf02","observation_id":"eb319be1-0dd1-4b26-a26b-d5a732be27aa","resolution":{"observed_at":"2026-08-07T15:29:49.670291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.551051Z","title":null,"venue":null,"work_id":"6437515a-ed26-4101-a1a1-671899f3155d","year":2024},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.167157Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:a0ecda3bc6c1c1a78f12db64e285f105bdd804ac58095d96949b549f31ecbf1a","observation_id":"7de1c634-0e51-4e0c-926b-1730fe63f9fd","resolution":{"observed_at":"2026-08-07T15:29:49.600286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.456607Z","title":null,"venue":null,"work_id":"398ae352-38b5-428d-937d-c04e346d6a04","year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.263771Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:3c0e38930226e4f631d5729609eb1336a35c0fd23a457b21434f7add47d592c1","observation_id":"f8d70b68-4efb-4b33-90cb-1371c0060446","resolution":{"observed_at":"2026-08-07T15:29:49.502077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:45.357991Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.357991Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:253943069340b383921f0ae8a663d76cf2eb206272301b017a40e6194edf8e4c","observation_id":"550a2488-0789-4df3-87ee-9969e6210caa","resolution":{"observed_at":"2026-08-07T15:29:45.357991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09469","last_updated":"2021-04-19T17:33:07Z","snapshot_observed_at":"2026-08-16T18:30:28.789587Z","submitted_at":"2021-04-19T17:33:07Z","title":"Training Value-Aligned Reinforcement Learning Agents Using a Normative Prior","version":1},"cited_work":{"arxiv_id":"2104.09469","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.09469","snapshot_observed_at":"2026-08-07T15:29:48.319428Z","title":"Training Value-Aligned Reinforcement Learning Agents Using a Normative Prior","venue":"cs.LG","work_id":"6e47911e-d053-4ce9-95bb-dde203b1fa4a","year":2021},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.440912Z"},"links":{"cited_paper":"/paper/2104.09469","citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:fb4d77285d398b50cc2f479230e8267fb51ddf24651587bb3e66026577de25a4","observation_id":"a3dbad0a-4ed1-45e7-97ba-f38945127bb1","resolution":{"observed_at":"2026-08-07T15:29:48.390968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:45.536818Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.536818Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:e7c026517050de804c8132d81e9d21db4655d60f334596cc51725383d8263262","observation_id":"af378706-719e-4f27-b0e4-215f3a9c79b6","resolution":{"observed_at":"2026-08-07T15:29:45.536818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.297330Z","title":"Neufeld, Ezio Bartocci, and Agata Ciabattoni","venue":null,"work_id":"208b7a6d-a10f-48ba-bb00-c3460def89fa","year":2022},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.659152Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:f30d88c37f5295d77e4ea7c239a09b5a9e865643cae62e754e719a4e252bc71d","observation_id":"31e0eabc-f2b7-47cc-a689-0f23b5163ca9","resolution":{"observed_at":"2026-08-07T15:29:49.401537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:49.145024Z","title":"Neufeld, Ezio Bartocci, Agata Ciabattoni, and Guido Governatori","venue":null,"work_id":"3ff85a9a-062d-4de4-9d61-66d5713068e6","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.791671Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:0af14d656b527c3935a95eeb4d1c7ff5a696f1e153f1a813ec896bbbad1a3fcd","observation_id":"28df5bc8-b13f-4eb6-a5f9-1b6c73d43956","resolution":{"observed_at":"2026-08-07T15:29:49.215661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2019/891","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Varshney, Murray Campbell, Moninder Singh, and Francesca Rossi","venue":null,"work_id":"c9c70cb2-3c25-426a-9bfe-a303dea4fe68","year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.016637Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:9f9d4a099b80672362a10598bc1c9fe2d0879daa87d1a03da48799409b3ca196","observation_id":"3f6dd90d-8610-495a-bfe2-0a004950ee3f","resolution":{"observed_at":"2026-08-07T15:29:47.389279Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:46.133292Z","title":"Osoba, Benjamin Boudreaux, and Douglas Yeung","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.133292Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:97e05752fc88089a8ff513bffd05de346423d01938d1961a3d80d65106eb3b7d","observation_id":"ea220ad8-f90a-4872-a2df-eff8584e2783","resolution":{"observed_at":"2026-08-07T15:29:46.133292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:46.189575Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.189575Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:30f14a4c7cc1b1e9d8b5a2d161d5fe06965f4a8bc55066172b94bb260637b977","observation_id":"ef64e642-b235-4f0e-ba81-6653850dc5e2","resolution":{"observed_at":"2026-08-07T15:29:46.189575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.990852Z","title":"Oliehoek, and Luciano C","venue":null,"work_id":"e5fa9669-a8da-4e61-a0cc-587be068ef73","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.262577Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:0fcab8afa08096324b2b511d4d9f48da0305443b25b0e04ecfb42336b1cea318","observation_id":"4854d889-93a8-40a6-bedc-e52c39514889","resolution":{"observed_at":"2026-08-07T15:29:49.069779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.777253Z","title":null,"venue":null,"work_id":"2a9f62f3-b38c-4fa0-b100-008152e1caf2","year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.373662Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:fbfb0ff7cee9febcd3fbc18f8d04ed2712e7783a24d06cc2651e3f1aab14e6f7","observation_id":"8e0d87da-b920-4c2c-be6b-fe776b1211e7","resolution":{"observed_at":"2026-08-07T15:29:48.798664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:46.489529Z","title":"Shaw, Andreas Stöckel, Ryan W","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.489529Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:e595994afc417596db7e761bed6172cf45a6bef3463003023ad61b9f4323d3cc","observation_id":"f2e25747-3b2a-4679-bd64-903669f2310d","resolution":{"observed_at":"2026-08-07T15:29:46.489529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.870193Z","title":"InProceedings of the 21st International Conf","venue":null,"work_id":"35af75ac-e538-48a6-95c3-2c5adc71ec3a","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.320335Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:a8ab712b1e7c615bd43528b8e96591d27b7d1839ad15005e166f73e60195100a","observation_id":"dee9b111-49f4-4194-8121-6ad689b612e3","resolution":{"observed_at":"2026-08-07T15:29:48.925273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-20T14:54:13.220333Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-07T15:29:46.611548Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.611548Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:b3ce7ba4d81a2294c51a808f8f260c6479612aa599838f6b64c8a3d6b8af7520","observation_id":"164746cd-c772-4674-847e-d9d152fddccd","resolution":{"observed_at":"2026-08-07T15:29:46.611548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:46.745452Z","title":"Czarnecki, Michaël Mathieu, An- drew Dudzik, Junyoung Chung, David H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.745452Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:c7964ab766adb96ea7fc2a61f186c35861a866e55cb79a03490fe7c523034e11","observation_id":"c5cc2ca7-15bb-4bdf-ae16-5cb09a9a0ce0","resolution":{"observed_at":"2026-08-07T15:29:46.745452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.687404Z","title":null,"venue":null,"work_id":"29734ad3-2304-4e88-a908-52639bd5e6fd","year":2016},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.846243Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:bd61ca3e9ab312b74e8a164ddc0412d83898adc626bd95a87625649d20894b03","observation_id":"b4cb5ffb-dfe9-4aa1-a9a3-1a7754de3f93","resolution":{"observed_at":"2026-08-07T15:29:48.726223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"biblio/1030136","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.029007Z","title":null,"venue":null,"work_id":"60e15c91-ee25-45e2-af8c-52959a2d0619","year":2017},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.535647Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:0232d998a7da9aede20b85cc8d6abcf65159e2e4c4ccdd0ec67ec177407bb397","observation_id":"1d695a29-cbb7-42db-84d1-e8ec1032ec9c","resolution":{"observed_at":"2026-08-07T15:29:48.085845Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:48.596503Z","title":null,"venue":null,"work_id":"79d88159-16bc-4608-a7c5-a41e9f6c684e","year":2018},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.948522Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:f150a78466cfbfe7b396aeae50bad07ab79ecb3d863480b8463ab41cda52e080","observation_id":"948d17fb-3f1e-4d04-b5fe-c84cdc96c77d","resolution":{"observed_at":"2026-08-07T15:29:48.634613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:44.163712Z","title":"on Artificial Intelligence33, 01 (Jul","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:44.163712Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:9f72cd51869bdf50337add83483c96cd3d6bfc60aaf20b3d380c7480b9fa6ad8","observation_id":"fc70aa8e-b68e-466b-8639-77ca9f51adef","resolution":{"observed_at":"2026-08-07T15:29:44.163712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:29:45.894600Z","title":"https://doi.org/10.1007/s10676- 022-09665-8","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:45.894600Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:67a50676b8038b372b36454fc5db2e2594fc5ab2f58c41f29955b4aca4190b34","observation_id":"505f516f-aac2-40d8-99ee-83f6560d8370","resolution":{"observed_at":"2026-08-07T15:29:45.894600Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v33i01.33019785","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"4659bd71-d6c3-4c0f-af18-7b6d8a9e8b79","year":null},"citing_paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning","version":1},"reference_index":9789,"source":"pdf_text","source_observed_at":"2026-08-07T15:29:46.434752Z"},"links":{"citing_paper":"/paper/2505.15011"},"observation_digest":"sha256:cfdcf9dd8a75ca7845453e097647a4b7f7064c150fe053d5b6d6f05057978fca","observation_id":"4fb8835b-2bb1-4ef5-8d8d-ea135d9da299","resolution":{"observed_at":"2026-08-07T15:29:47.165029Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15011","last_updated":"2025-05-21T01:32:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T14:54:51.300535Z","submitted_at":"2025-05-21T01:32:54Z","title":"HAVA: Hybrid Approach to Value-Alignment through Reward Weighing for Reinforcement Learning"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":7,"verified_fuzzy":5},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2505.15011."}