{"as_of":"2026-08-12T16:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7eb7c7e8753f0c05f33f881504d986bc521d415a91e1adfaab5edfbc120048c7","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:39:12.005657Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.04327/citation-record","integrity":"/paper/2412.04327/integrity","json":"/paper/2412.04327/citation-record.json","paper":"/paper/2412.04327"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-11T21:39:11.928666Z","title":"Safe exploration in continuous action spaces","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.928666Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:7116364dbd76ed9507848200ff84056eb72aeb5fdad73ab6a65c3b1a370e18f7","observation_id":"97fd7f80-2c1c-4987-8a9b-6814ec00a16a","resolution":{"observed_at":"2026-08-11T21:39:11.928666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.10682","last_updated":"2021-06-14T04:07:36Z","snapshot_observed_at":"2026-07-06T11:11:48.611160Z","submitted_at":"2021-05-22T10:40:58Z","title":"Feasible Actor-Critic: Constrained Reinforcement Learning for Ensuring Statewise Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.10682","snapshot_observed_at":"2026-08-11T21:39:11.955651Z","title":"Haitong Ma, Yang Guan, Shegnbo Eben Li, Xiangteng Zhang, Sifa Zheng, and Jianyu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.955651Z"},"links":{"cited_paper":"/paper/2105.10682","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:5f8221d2002a072d6fce1d742d6a2f045a5a891eee13b5fb6de100d0fe247bb4","observation_id":"05999720-a7d4-4a56-9c5c-e66a0a6ebcc1","resolution":{"observed_at":"2026-08-11T21:39:11.955651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T21:39:11.960949Z","title":"Alex Ray, Joshua Achiam, and Dario Amodei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.960949Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:e7319d0932fd9254a372078f4b3d9d2d1c98a224f26c0740bfe31c525be67a92","observation_id":"96f35f8a-f1fd-4bb7-b509-1ae6ea2e49c5","resolution":{"observed_at":"2026-08-11T21:39:11.960949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-11T21:39:11.966125Z","title":"High- dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.966125Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:b1f273e6cdd63ed2d2b7ee7a876eb038dd24f10a49aa34a1a2e3c394dd1003dd","observation_id":"6a1a3f2b-7fd3-4ba6-ac6a-352b744262ee","resolution":{"observed_at":"2026-08-11T21:39:11.966125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03704","last_updated":"2024-11-05T02:06:59Z","snapshot_observed_at":"2026-07-06T18:26:15.151211Z","submitted_at":"2024-06-06T02:55:16Z","title":"Excluding the Irrelevant: Focusing Reinforcement Learning through Continuous Action Masking","version":2},"cited_work":{"arxiv_id":"2406.03704","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.03704","snapshot_observed_at":"2026-08-11T21:39:12.105636Z","title":"Excluding the Irrelevant: Focusing Reinforcement Learning through Continuous Action Masking","venue":"cs.LG","work_id":"d5e35a05-ee11-48a2-a949-397a9f7ea713","year":2024},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.982996Z"},"links":{"cited_paper":"/paper/2406.03704","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:a3b007fc1000b11203136ab34c8121d55d0c7bcf316e504701b83b92255a2b1f","observation_id":"d8bcd68a-5b75-45fe-9f23-fe56df76a5a0","resolution":{"observed_at":"2026-08-11T21:39:12.111309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07129","last_updated":"2024-09-16T12:10:08Z","snapshot_observed_at":"2026-08-06T11:52:39.186598Z","submitted_at":"2024-03-11T19:52:00Z","title":"RaceMOP: Mapless Online Path Planning for Multi-Agent Autonomous Racing using Residual Policy Learning","version":2},"cited_work":{"arxiv_id":"2403.07129","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.07129","snapshot_observed_at":"2026-08-11T21:39:12.077747Z","title":"RaceMOP: Mapless Online Path Planning for Multi-Agent Autonomous Racing using Residual Policy Learning","venue":"cs.RO","work_id":"1d9c089e-ad9f-4e0d-8c31-909cfecaa6c6","year":2024},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.988838Z"},"links":{"cited_paper":"/paper/2403.07129","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:38657dd5454e1d7ea287f887eaee35a5db9090fc38b063c30adf92c69e8ca681","observation_id":"083d31d0-75dc-4126-bd6a-00f468607559","resolution":{"observed_at":"2026-08-11T21:39:12.086025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11814","last_updated":"2022-06-17T02:39:04Z","snapshot_observed_at":"2026-08-08T10:57:38.673995Z","submitted_at":"2022-05-24T06:15:51Z","title":"Penalized Proximal Policy Optimization for Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11814","snapshot_observed_at":"2026-08-11T21:39:11.994473Z","title":"12 Linrui Zhang, Li Shen, Long Yang, Shixiang Chen, Bo Yuan, Xueqian Wang, and Dacheng Tao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.994473Z"},"links":{"cited_paper":"/paper/2205.11814","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:f9ee6735423bf14ae527faf8acab5ab4c1bcf4d5442d9e140c86545108091ca8","observation_id":"2187593e-e1e6-4cd9-b695-80d81a08ed3d","resolution":{"observed_at":"2026-08-11T21:39:11.994473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:39:12.290106Z","title":null,"venue":null,"work_id":"e21fc245-6ea3-465b-87b3-a73e092bb30b","year":2024},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:12.005657Z"},"links":{"citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:5a81c3d46cc2a7dc7c10755d2c6668dc31f100b66af8d90d78e78cda1e86da01","observation_id":"d53b5711-1645-427e-84c0-ffa6c9bbe208","resolution":{"observed_at":"2026-08-11T21:39:12.294747Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T21:39:11.972205Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.972205Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:2d1d7f25885ff2183ea1890eb55d102b8b1c54dc10cdaa8603b2bf1f17c6b3d1","observation_id":"9ec14cd6-f8f0-4220-b0b0-ed3bc72dc424","resolution":{"observed_at":"2026-08-11T21:39:11.972205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14603","last_updated":"2020-10-27T20:53:20Z","snapshot_observed_at":"2026-07-06T10:09:10.434213Z","submitted_at":"2020-10-27T20:53:20Z","title":"Learning to be Safe: Deep RL with a Safety Critic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14603","snapshot_observed_at":"2026-08-11T21:39:11.977292Z","title":"Learning to be safe: Deep rl with a safety critic","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.977292Z"},"links":{"cited_paper":"/paper/2010.14603","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:676e95f8d74d8d3811df421ee1488b303d6321e3c051c8083d5c145f1728c57f","observation_id":"34ee1234-8034-48d5-894a-9d9845beab7a","resolution":{"observed_at":"2026-08-11T21:39:11.977292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14171","last_updated":"2022-05-31T01:58:03Z","snapshot_observed_at":"2026-07-06T09:32:36.048721Z","submitted_at":"2020-06-25T04:47:09Z","title":"A Closer Look at Invalid Action Masking in Policy Gradient Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14171","snapshot_observed_at":"2026-08-11T21:39:11.945279Z","title":"A closer look at invalid action masking in policy gradient algorithms","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.945279Z"},"links":{"cited_paper":"/paper/2006.14171","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:61385232c6d1b96795270aa989612b01cef0324a44a1cad67a1a053781526d39","observation_id":"c50f1d80-fa3f-41ac-af74-e2ad62556fc9","resolution":{"observed_at":"2026-08-11T21:39:11.945279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10031","last_updated":"2019-02-11T20:52:42Z","snapshot_observed_at":"2026-08-04T06:42:19.463125Z","submitted_at":"2019-01-28T23:14:58Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10031","snapshot_observed_at":"2026-08-11T21:39:11.923300Z","title":"Lyapunov-based safe policy optimization for continuous control","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.923300Z"},"links":{"cited_paper":"/paper/1901.10031","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:85208f1e477878879b6b4253def61ff6ac29da2f9a2f0de876c3f942a2c78046","observation_id":"8feeebb4-3998-42f7-9843-17fff94009c1","resolution":{"observed_at":"2026-08-11T21:39:11.923300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:39:12.306274Z","title":"Safe reinforcement learning for autonomous lane changing using set-based prediction","venue":null,"work_id":"962adaf7-073f-4513-831c-242b88f0f43c","year":2020},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.950595Z"},"links":{"citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:54b5eb7802d48149fdd7fbe98542d0c4c204212e287b8cef93a40150fd7a5166","observation_id":"e0592a37-9612-4e8e-9015-700333029c65","resolution":{"observed_at":"2026-08-11T21:39:12.311768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14497","last_updated":"2021-04-26T17:38:23Z","snapshot_observed_at":"2026-07-06T10:09:06.864468Z","submitted_at":"2020-10-27T17:54:25Z","title":"Conservative Safety Critics for Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14497","snapshot_observed_at":"2026-08-11T21:39:11.917036Z","title":"Conservative safety critics for exploration","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.917036Z"},"links":{"cited_paper":"/paper/2010.14497","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:e09dcb7b06c2a22ce815c64914e2b43286c00da055c790b559351c03f60fcbde","observation_id":"bd1b9821-a7db-4cbd-9802-90cf01a2c2b9","resolution":{"observed_at":"2026-08-11T21:39:11.917036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-10T17:16:29.612396Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-11T21:39:11.939149Z","title":"Learning pseudometric- based action representations for offline reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.939149Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:414035839f955246fb645502e7655b3a131c1c4db23629631b9adbe017ae919f","observation_id":"1a9e4239-f93f-40a9-9e5a-a294b0382eac","resolution":{"observed_at":"2026-08-11T21:39:11.939149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03122","last_updated":"2023-06-30T19:12:31Z","snapshot_observed_at":"2026-08-11T02:09:16.770324Z","submitted_at":"2023-02-06T21:11:29Z","title":"State-wise Safe Reinforcement Learning: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03122","snapshot_observed_at":"2026-08-11T21:39:11.999964Z","title":"State-wise safe reinforcement learning: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.999964Z"},"links":{"cited_paper":"/paper/2302.03122","citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:6db2ff1d109ee6dda4113953276f9aacaced81015d6bdd5b2494b9b82f87dbc5","observation_id":"350272cd-c349-4cbb-a677-6fefca8699a8","resolution":{"observed_at":"2026-08-11T21:39:11.999964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:39:12.322377Z","title":"Niklas Funk, Georgia Chalvatzaki, Boris Belousov, and Jan Peters","venue":null,"work_id":"f516bad3-be20-41ae-ba77-297839d5f4e0","year":2024},"citing_paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T21:39:11.934161Z"},"links":{"citing_paper":"/paper/2412.04327"},"observation_digest":"sha256:0ba64b50d6ba0c12a7aecbb9e709d62cbc2e056c9a68bb359e524acb0561da3d","observation_id":"ead9282f-7d07-40b5-a522-5db4c326d1ea","resolution":{"observed_at":"2026-08-11T21:39:12.327333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04327","last_updated":"2024-12-05T16:42:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T21:29:45.742994Z","submitted_at":"2024-12-05T16:42:45Z","title":"Action Mapping for Reinforcement Learning in Continuous Environments with Constraints"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 0 inbound Pith citation observations for arXiv:2412.04327."}