{"as_of":"2026-08-16T17:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ade466889a06368eddb5d5136940f2dc05b9945783a25728c5d4e7e40857ebe3","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:26:41.702511Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01883/citation-record","integrity":"/paper/2508.01883/integrity","json":"/paper/2508.01883/citation-record.json","paper":"/paper/2508.01883"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:45.514096Z","title":"Safe exploration in continuous action spaces, 2018","venue":null,"work_id":"4da0fa0c-1d2b-4c0d-9e04-2b5c0470f2be","year":2018},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:38.755778Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:257db419d924f3c48cf12967eaa2bb210069ad9d1da606145c8e5d197c1c746e","observation_id":"158c1d0a-84f8-4e6d-a6f6-822a4f06fc5f","resolution":{"observed_at":"2026-08-06T05:26:45.597366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:38.856977Z","title":"A lyapunov-based approach to safe reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:38.856977Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:ee42f074b95363d2bc814e7b240a422bf995ed2efc1b6114269880317f69c452","observation_id":"8c770962-57f9-42a2-a67b-b091b3d94b69","resolution":{"observed_at":"2026-08-06T05:26:38.856977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:45.337192Z","title":"Lyapunov-based safe reinforcement learning for microgrid energy management.IEEE transactions on neural networks and learning systems, 2024","venue":null,"work_id":"005652c3-3d63-4878-84c2-ed4f4c0ada7d","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:38.949435Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:051ff43bbdac7ecaea2d477d58fe01f9cd760b51b2b92818a374d1c05a86f758","observation_id":"9107fa5c-4e99-473c-8222-a1263edd31d0","resolution":{"observed_at":"2026-08-06T05:26:45.400330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-14T19:10:15.765536Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-06T05:26:39.090493Z","title":"Reward constrained policy optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.090493Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:c142e90e20a76706e68adf2d178be7f80cd9e54340961e2ab4e411b344fd6d20","observation_id":"7cb9a1bb-0a77-456a-93c4-7d1eb72ba55e","resolution":{"observed_at":"2026-08-06T05:26:39.090493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:39.201603Z","title":"A review of safe reinforcement learning: Methods, theories and applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.201603Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:803885cca013c3bc1f2b0e91e77c56e062ea985ca4bab9aadea5f887699e3374","observation_id":"7d7809c2-a09d-4131-add5-db0c898de8be","resolution":{"observed_at":"2026-08-06T05:26:39.201603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:45.129125Z","title":"Cvar-constrained policy optimization for safe reinforcement learning","venue":null,"work_id":"d201210c-06f6-415d-931c-e454d52f864b","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.344167Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:3572f8ba34ffcebe36bf32f2fe8b1aaafc8c796e054e8dd32cae0f33426227a1","observation_id":"dfdbf03e-c4e2-4a24-9ec1-0a616736697b","resolution":{"observed_at":"2026-08-06T05:26:45.212121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:44.876265Z","title":"Safe reinforcement learning for multi-agent systems with risk constraints","venue":null,"work_id":"c98635b7-db33-4dab-85cb-0c38792af272","year":2025},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.493126Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:811dc8f2d075877f7c3b82269c50d7295c771ece37301a073aee552490326f0e","observation_id":"25954455-b329-4f15-853e-1ab49c69c1cd","resolution":{"observed_at":"2026-08-06T05:26:45.017761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:44.708159Z","title":"Lyapunov-based safe policy optimization for continuous control, 2019","venue":null,"work_id":"a618849e-1c3e-4006-83f5-70379cd4bae1","year":2019},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.574101Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:72b9d2319142d3db2b63be81608505591a73dd8816a45219ce726db040d8ecfd","observation_id":"21b67990-3376-4db2-b984-bbac0bf513a4","resolution":{"observed_at":"2026-08-06T05:26:44.769847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:39.672273Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.672273Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:90bf6a9ee0369dfe1a74fbda5cc116931aeed2054876c91e0557401b2d657b70","observation_id":"17118456-c96d-4c44-b024-1d6d4f6219be","resolution":{"observed_at":"2026-08-06T05:26:39.672273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:44.500439Z","title":"Soufi Enayati, Mehran Ghafarian Tamizi, and Homayoun Najjaran","venue":null,"work_id":"8f25f6b4-9739-4e6d-8424-910cecd93535","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.772541Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:e9d9f28d984bf16b16e9d34f01cc8b8c20143eb9eece45edc107bd76a0133825","observation_id":"35880f46-6317-4f9a-8698-05ac91fbb800","resolution":{"observed_at":"2026-08-06T05:26:44.588775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:44.345196Z","title":"A survey of constraint formulations in safe reinforcement learning, 2024","venue":null,"work_id":"4783c938-ec85-41da-b79e-c44e120ad4b9","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.862428Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:77e371950c81976b54d93f3bb2799328f302f98ae4cce40e0cc2d38f2713207e","observation_id":"dc73e218-5bfb-4075-89f4-7853786c8c85","resolution":{"observed_at":"2026-08-06T05:26:44.430941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03152","last_updated":"2020-10-07T04:22:45Z","snapshot_observed_at":"2026-08-10T08:43:44.490290Z","submitted_at":"2020-10-07T04:22:45Z","title":"Projection-Based Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03152","snapshot_observed_at":"2026-08-06T05:26:39.944282Z","title":"Projection-based constrained policy optimization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:39.944282Z"},"links":{"cited_paper":"/paper/2010.03152","citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:c5483e0c107e41dc8f5dda32965622aeaa9e05d4f97b4fbcd7e5469404bdab07","observation_id":"69baed02-188c-4f37-84b3-29394e97d553","resolution":{"observed_at":"2026-08-06T05:26:39.944282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:44.232087Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":"30b4dd7d-8b11-45d2-b0fe-ee9896459454","year":2018},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.042380Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:ca5fba964b37c52827957574bbded7e77767e6ea818c18361b720ed0b24633d5","observation_id":"c184f696-0fc4-4987-91df-61f0d986fd55","resolution":{"observed_at":"2026-08-06T05:26:44.278532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:40.158865Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.158865Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:79a7da02a0d87f9708e1a9f82db1276e64daf5c33d9ccbf0663642f4e3cea315","observation_id":"1d51875b-3f80-43d4-a743-6fa57a6b21ab","resolution":{"observed_at":"2026-08-06T05:26:40.158865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:44.069869Z","title":"Safe reinforcement learning using advantage-based intervention","venue":null,"work_id":"d2f1cca1-fb03-48b2-80ba-1ca914c6939c","year":2021},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.273470Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:36bde86cd591773db102b61af7175893f8b4dae6374a21c2c58187321b431d32","observation_id":"712f9f21-044c-4653-8c19-b3b69a38efb9","resolution":{"observed_at":"2026-08-06T05:26:44.152979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:43.958384Z","title":"Provably efficient primal-dual reinforcement learning for cmdps with non-stationary objectives and constraints","venue":null,"work_id":"611cd956-7df0-4fd4-96c6-88014c9b3728","year":2023},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.366679Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:8656fa19cd00832dc706023417d11af51c756ac33ac1a4ae98129d8809de201c","observation_id":"1223e959-01da-4f0f-95b3-0f492f85ad12","resolution":{"observed_at":"2026-08-06T05:26:43.998691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:43.842076Z","title":"Scalable primal- dual actor-critic method for safe multi-agent rl with general utilities","venue":null,"work_id":"a0c955e4-dba2-4e1d-9841-5bf1123795f7","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.479056Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:fae5c67d055e316ecb7b6ba568dabec364d6df3312d6f2f78707fc70a3d0fa48","observation_id":"90958591-c93f-48bf-acba-838bfe795348","resolution":{"observed_at":"2026-08-06T05:26:43.903161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:43.698813Z","title":"Adaptive primal-dual method for safe reinforce- ment learning, 2024","venue":null,"work_id":"f0b12183-2246-4184-a9c6-c31882c88a1f","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.594650Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:0c901b9acd997f20f1be1e50b857ed209175c93063440dd6169ce6e8430c2bc7","observation_id":"fbf3189f-7c34-49e7-aee6-a0dcf555708d","resolution":{"observed_at":"2026-08-06T05:26:43.771070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:43.537386Z","title":"Balance reward and safety optimization for safe reinforcement learning: A perspective of gradient manipulation","venue":null,"work_id":"568294f6-f693-46d1-be73-e9102472e09b","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.692585Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:58c827bf3b105196085e885bb3f76b8c8fdf088fa4e567c080d40334681f02d6","observation_id":"abb19f79-54c5-445b-a110-6ecf2a944da9","resolution":{"observed_at":"2026-08-06T05:26:43.612791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:43.413674Z","title":"Safe cor: A dual-expert approach to integrating imitation learning and safe reinforcement learning using constraint rewards","venue":null,"work_id":"c0b7c40e-16da-46c1-b1cd-ca6c0cbf7d76","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.768219Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:d49cd1ae932ac98a592ff2e55d659ee3f1d89c86d81731675c47affd1cbff63c","observation_id":"bd75ed25-de71-418e-8265-a3878072853d","resolution":{"observed_at":"2026-08-06T05:26:43.462053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:43.258835Z","title":"Safe reinforcement learning via episodic control","venue":null,"work_id":"f4599e28-8745-46ae-bcc0-a73cf5db6350","year":2025},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.854334Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:bb589828466153b9b3b5b1cee695484a6bd69238ba3c44ae0c4a893abc4d3bb6","observation_id":"4f735d69-43ea-4c44-b06e-f32235da32ee","resolution":{"observed_at":"2026-08-06T05:26:43.327459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:43.053242Z","title":"Comprehensive overview of reward engineering and shaping in advancing reinforcement learning applications","venue":null,"work_id":"adc5b06c-2bc6-4c40-977a-45a54bcf6fa1","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:40.933393Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:e0195d680aa3fec21ddaf73f0d0ea00345fd6ae89acc2930b6aa8c5804cce02b","observation_id":"730a5251-5b7c-405b-93a1-3c6824cdfb27","resolution":{"observed_at":"2026-08-06T05:26:43.126303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:42.860610Z","title":"A review of safe reinforcement learning methods for modern power systems","venue":null,"work_id":"2ef8b21c-91f5-4ba8-9371-be08a49e62ec","year":2025},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.025604Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:dda5d70a307cc83b73d0f569c1dc81e0edb13c4a2ce838421c60a23891939cb8","observation_id":"3e5e93af-91a8-42d0-bd39-283a535f8cff","resolution":{"observed_at":"2026-08-06T05:26:42.946267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:41.098054Z","title":"Constrained Markov decision processes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.098054Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:6a2ae868593f16243357086b8bd335e2688ff177d0216937ecb2926b97c12ea9","observation_id":"7f434828-22fa-4faf-aad4-c3659ecf033c","resolution":{"observed_at":"2026-08-06T05:26:41.098054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:42.707114Z","title":"Reinforcement learning, 2015","venue":null,"work_id":"664645e7-1002-435b-ab64-e7f793708d81","year":2015},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.160613Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:8382adaad8634eefe624eae995c2de6be553ad87bcb7872f3ccc6282442a7790","observation_id":"0f0ee32c-7a79-4a4e-b7d0-8b28b8b53bbf","resolution":{"observed_at":"2026-08-06T05:26:42.769405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:41.251357Z","title":"Asynchronous methods for deep reinforce- ment learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.251357Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:b3d59175b90fa17748814312805bf89fe780c77e59d7391429dfe72a03b13c82","observation_id":"c2a75454-4b9a-4462-9e1c-b6d578cdd7b6","resolution":{"observed_at":"2026-08-06T05:26:41.251357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:41.316580Z","title":"Constrained deep networks: Lagrangian optimization via log-barrier extensions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.316580Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:8832f6c535b65df808d8dbb903c13e00e9c3d38542ef2a25b026b67add1dfb17","observation_id":"96babdb9-16e3-42da-8e6c-e4d1a9a1d8f9","resolution":{"observed_at":"2026-08-06T05:26:41.316580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:42.531185Z","title":"A tutorial on mm algorithms","venue":null,"work_id":"054fcd96-cce2-468b-844b-e007247f1927","year":2004},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.379442Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:eae204ec0894795da9d28c352b8036861f5df797f1e1361f903ad254bea51aeb","observation_id":"8189934b-557a-43e5-aa0b-eafd085a65df","resolution":{"observed_at":"2026-08-06T05:26:42.576444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:42.365793Z","title":"Safety gymnasium: A unified safe reinforcement learning benchmark","venue":null,"work_id":"793cc8af-6ec9-42af-b977-6a0aac900891","year":2023},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.440539Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:583c2db92cda7fff0d0a4759ddca315e7a8d6cb2a8dd33be2472c26e57861300","observation_id":"2cc1ca94-bbdd-476f-98c4-5d4883ce31e4","resolution":{"observed_at":"2026-08-06T05:26:42.435045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:42.236443Z","title":"Constrained update projection approach to safe policy optimization","venue":null,"work_id":"427e32bd-0807-4fc8-a050-8ba4ecfcc6ac","year":2022},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.506850Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:31207a08d4af62e82f5ad01245b940320b6d86d9465fc4ddb3c7f79e1d38e544","observation_id":"9eac2dca-eb20-4493-b0ca-fde350a1a3be","resolution":{"observed_at":"2026-08-06T05:26:42.315793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:42.114617Z","title":"First order constrained optimization in policy space","venue":null,"work_id":"2a9182a4-abb8-4bf7-9311-c872cd1f849c","year":2020},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.574762Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:796572452a3a592200ddfabb9ffb848c8d0470c135b58176f78e2958569726bf","observation_id":"60bb6ac8-e7bf-4a41-8bcc-a64de835a208","resolution":{"observed_at":"2026-08-06T05:26:42.162364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:41.646373Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.646373Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:45be53453d5363bf009b8351a877a11fdd14678e955e5242916bb7f4084f0301","observation_id":"91f14207-99f6-4e88-ad5d-3f74c8fcc513","resolution":{"observed_at":"2026-08-06T05:26:41.646373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:26:41.910844Z","title":"repulsive force","venue":null,"work_id":"5210cc8b-3ab5-4c40-8469-b0858748f138","year":2024},"citing_paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:26:41.702511Z"},"links":{"citing_paper":"/paper/2508.01883"},"observation_digest":"sha256:173e891ef2287277773a482d5e843e1b6ab307950b371bf0455ea070ef49b257","observation_id":"b7862b4c-a11e-45be-8c1c-e40d78bea53d","resolution":{"observed_at":"2026-08-06T05:26:41.994351Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.01883","last_updated":"2025-08-06T13:50:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T16:27:58.377704Z","submitted_at":"2025-08-03T18:35:55Z","title":"Proactive Constrained Policy Optimization with Preemptive Penalty"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2508.01883."}