{"as_of":"2026-08-20T23:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49845aca57c0392a6709d3fe30b73d05cd06856d3674399e93421890407e69c2","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:33:37.721942Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08880/citation-record","integrity":"/paper/2412.08880/integrity","json":"/paper/2412.08880/citation-record.json","paper":"/paper/2412.08880"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.528192Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.528192Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:10ba9ab8eb8ba33f96f796e22957e366be42f16e1df4052df928e63b89826bd9","observation_id":"484da714-e99a-4520-b896-f63ea4633c16","resolution":{"observed_at":"2026-08-11T17:33:37.528192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.301684Z","title":"Maximum entropy inverse reinforcement learning in continuous state spaces with path integrals","venue":null,"work_id":"1fcba39b-8c0e-4f2a-98ef-bdbd88d7c0a0","year":2011},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.534971Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:364dc7e01db0a5b7045901776bee32b68402665421b411d8c2b209b95bfd6d39","observation_id":"614de274-5e77-4761-80bf-c28644564dc3","resolution":{"observed_at":"2026-08-11T17:33:38.307332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.284029Z","title":"Constrained markov decision processes with total cost criteria: Lagrangian approach and dual linear program","venue":null,"work_id":"fe7de8a1-d67e-44a5-92f2-da73b04e10f2","year":1998},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.540639Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:0d26734fd26b9fecbef04abd5f9db320cc3950a259a6949e2de08d789acf8489","observation_id":"a791a083-db0d-40e6-93c3-9d19b8d87889","resolution":{"observed_at":"2026-08-11T17:33:38.289432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.547006Z","title":"Constrained Markov decision processes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.547006Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:8ffb752c9aa39e906ef0cbee0b566beb3ee7c9b391414ddea76e1f1f6d12234f","observation_id":"1db5df65-eda1-4c92-9873-86c4032d64d4","resolution":{"observed_at":"2026-08-11T17:33:37.547006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.552930Z","title":"Convex optimization","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.552930Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:58f356ff959a65afccf780be4ea9d75460815a6e930a8e7acceed3aefef5e7a8","observation_id":"636cafb2-0f7b-4233-ad75-f1032fce1913","resolution":{"observed_at":"2026-08-11T17:33:37.552930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.558683Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.558683Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:ddcaf4f52059adc81a94b8d656003177d66062968af24e616c17a2a960d4bae6","observation_id":"93c8ef20-0422-4cfb-86d2-28ba9d322c2a","resolution":{"observed_at":"2026-08-11T17:33:37.558683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.564869Z","title":"Pybullet, a python module for physics simulation for games, robotics and machine learning, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.564869Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:fb6b96b85eca058983b8aa5ad673dced9bfd764a7288f671465e71899669a2b2","observation_id":"6b258255-db0c-43f1-a7bd-bd18cb70c4f6","resolution":{"observed_at":"2026-08-11T17:33:37.564869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.220692Z","title":"Directional differentiability of optimal solutions under slater's condition","venue":null,"work_id":"bac436f4-d800-4bff-b1fe-95a3ca0f0784","year":1993},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.569920Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:2b334c8cd79646d63461df4dc1996d7d9a3a76cecb1133cc92290ff72d2e0e98","observation_id":"9256cbd1-13c6-4efa-8f2c-b3a2e828c268","resolution":{"observed_at":"2026-08-11T17:33:38.226032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06766","last_updated":"2019-02-18T19:10:18Z","snapshot_observed_at":"2026-08-14T17:14:45.134923Z","submitted_at":"2019-02-18T19:10:18Z","title":"Parenting: Safe Reinforcement Learning from Human Input","version":1},"cited_work":{"arxiv_id":"1902.06766","doi":null,"metadata_source":"pith","pith_arxiv_id":"1902.06766","snapshot_observed_at":"2026-08-11T17:33:37.999325Z","title":"Parenting: Safe Reinforcement Learning from Human Input","venue":"cs.AI","work_id":"c0ca60fb-0729-4388-ba15-8eb4ad8a69ff","year":2019},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.574512Z"},"links":{"cited_paper":"/paper/1902.06766","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:d79781725dcd5675eb2b42b5631e83f6482398c03088f81792563beea9e8ddfc","observation_id":"71a64338-d0d0-4560-ad92-c457ed052236","resolution":{"observed_at":"2026-08-11T17:33:38.005117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.580345Z","title":"A comprehensive survey on safe reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.580345Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:64faae394f06019f4e83cdcd9292a68e74883b5cc00756766c99068b51777720","observation_id":"0deffe96-4c7c-4b64-bbfd-34b362135362","resolution":{"observed_at":"2026-08-11T17:33:37.580345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.194830Z","title":"A primal-dual augmented lagrangian","venue":null,"work_id":"577889bf-c127-4b36-8da1-a4ddc85ef4c7","year":2012},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.585226Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:9d021836eb7d8018a8b4327091270cc876f3af79b231f844890f2a5c8fb1e15d","observation_id":"1d1f6f5a-aa67-4549-8be7-782a782f91a4","resolution":{"observed_at":"2026-08-11T17:33:38.199580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.592440Z","title":"Bullet-safety-gym: A framework for constrained reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.592440Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:4131fd4d3e419cf184c4fc6f59efcb9c716f68f54e4f6840353d996582a94fb3","observation_id":"c38cf8b3-58f2-4f41-9428-ffadf8c3f167","resolution":{"observed_at":"2026-08-11T17:33:37.592440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10330","last_updated":"2024-05-24T22:33:04Z","snapshot_observed_at":"2026-08-20T13:48:07.834342Z","submitted_at":"2022-05-20T17:42:38Z","title":"A Review of Safe Reinforcement Learning: Methods, Theory and Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10330","snapshot_observed_at":"2026-08-11T17:33:37.597399Z","title":"A review of safe reinforcement learning: Methods, theory and applications","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.597399Z"},"links":{"cited_paper":"/paper/2205.10330","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:acdaea41c3938e04c5da21c5c6063e65bdaabbe3cf59c0ddd6eb9752a40304ce","observation_id":"8643a124-d913-4c15-9b1b-750249d9db3b","resolution":{"observed_at":"2026-08-11T17:33:37.597399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.602358Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.602358Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:d00c11703660ce10667c8479f2dd153cd3661af31bafef2795874ace54c72eb3","observation_id":"5ee64d99-f8cb-4f9c-9fd2-da6482429ed3","resolution":{"observed_at":"2026-08-11T17:33:37.602358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-11T17:33:37.606897Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.606897Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:6c1e884c9cc5771f594a68e40ba41a67ce1a765e9ae03b4d9a8bd1bf8b19cd21","observation_id":"866f1926-a3d6-47a9-aa85-735a1e3990d0","resolution":{"observed_at":"2026-08-11T17:33:37.606897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.612195Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.612195Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:664d20aa0551fd82cfa917af330392c8dcbf57c58ae5da9ea8110d05d036ac9f","observation_id":"a0e80708-02c8-4cf3-8516-cc6f0c593526","resolution":{"observed_at":"2026-08-11T17:33:37.612195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.147424Z","title":"Optidice: Offline policy optimization via stationary distribution correction estimation","venue":null,"work_id":"94af0ad5-7caa-44c7-8892-d9b91d4b4722","year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.617099Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:dd83be8962c279c52cbfe205843421e2df9765aef6efc27709eff3ee3f87dabc","observation_id":"6f5cde42-7188-4a64-b4b7-cf4fa14bf058","resolution":{"observed_at":"2026-08-11T17:33:38.152117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08957","last_updated":"2022-04-19T15:55:47Z","snapshot_observed_at":"2026-08-18T14:03:18.344581Z","submitted_at":"2022-04-19T15:55:47Z","title":"COptiDICE: Offline Constrained Reinforcement Learning via Stationary Distribution Correction Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08957","snapshot_observed_at":"2026-08-11T17:33:37.622251Z","title":"Coptidice: Offline constrained reinforcement learning via stationary distribution correction estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.622251Z"},"links":{"cited_paper":"/paper/2204.08957","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:dca0286c0f5560d675340198186de2e1949bf8f6e82ada9bdaa281d89dd588e2","observation_id":"14972fe8-b442-4a3d-9485-393ac1488e1b","resolution":{"observed_at":"2026-08-11T17:33:37.622251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-11T17:33:37.628179Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.628179Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:4b68a91425f1973f694e0d01a124f043933918dab2efef7456ef01085a2b24fa","observation_id":"f31ca234-8c65-48e2-ae24-d88c464fbdfd","resolution":{"observed_at":"2026-08-11T17:33:37.628179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09303","last_updated":"2023-06-16T17:54:06Z","snapshot_observed_at":"2026-08-16T15:23:34.841529Z","submitted_at":"2023-06-15T17:31:26Z","title":"Datasets and Benchmarks for Offline Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09303","snapshot_observed_at":"2026-08-11T17:33:37.634783Z","title":"Datasets and benchmarks for offline safe reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.634783Z"},"links":{"cited_paper":"/paper/2306.09303","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:f1ef72b26d095a015c769049af855a80ef42b50d43c33dc29c9e9f32ffae5aeb","observation_id":"33bf6911-2cbc-4a33-befc-e5bf0747f0d2","resolution":{"observed_at":"2026-08-11T17:33:37.634783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.132585Z","title":"Constrained decision transformer for offline safe reinforcement learning","venue":null,"work_id":"1474f60e-f1d8-4e52-9512-f93dafbea7e7","year":2023},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.640165Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:f8bddfda79415cd79e8bcf795830feae880f082fe91081c51659f174cc9800b2","observation_id":"1f0345e2-16b3-4acb-9857-da80b41b1e4f","resolution":{"observed_at":"2026-08-11T17:33:38.137434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.10682","last_updated":"2021-06-14T04:07:36Z","snapshot_observed_at":"2026-08-20T19:36:33.713858Z","submitted_at":"2021-05-22T10:40:58Z","title":"Feasible Actor-Critic: Constrained Reinforcement Learning for Ensuring Statewise Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.10682","snapshot_observed_at":"2026-08-11T17:33:37.645535Z","title":"Feasible actor-critic: Constrained reinforcement learning for ensuring statewise safety","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.645535Z"},"links":{"cited_paper":"/paper/2105.10682","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:b3add74a79a2f36022f0c93653587c18db9c4323b9984a089b16fcddc9f3cba3","observation_id":"16d8aabc-e554-40fc-a42a-dc56489c2632","resolution":{"observed_at":"2026-08-11T17:33:37.645535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-11T17:33:37.650823Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.650823Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:3846afcf44cd6fd3897f53fa0fa34e7574131acae1dca9e1ca94dbf6fef70a2a","observation_id":"cffaf56a-76eb-496b-89f8-c54cafa1ff6c","resolution":{"observed_at":"2026-08-11T17:33:37.650823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-20T03:06:00.034814Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-11T17:33:37.656127Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.656127Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:516a224dc24e3b15736e60aabed27dea2fb93eb7e0c3dab50cad7d7ec9bfcfeb","observation_id":"a21cab1a-23d3-4346-9d9e-152408a0540a","resolution":{"observed_at":"2026-08-11T17:33:37.656127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-11T17:33:37.661644Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.661644Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:ac3fae083e58bdf7b2b7ddb944464bd3910ed3f217c6e3e4ad390ab8edaab4d0","observation_id":"e4adc729-f884-4777-bc6c-968f6d854617","resolution":{"observed_at":"2026-08-11T17:33:37.661644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06440","last_updated":"2018-10-14T22:54:38Z","snapshot_observed_at":"2026-08-14T21:05:37.779686Z","submitted_at":"2017-04-21T08:33:59Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06440","snapshot_observed_at":"2026-08-11T17:33:37.667394Z","title":"Equivalence between policy gradients and soft q-learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.667394Z"},"links":{"cited_paper":"/paper/1704.06440","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:3d658f4263c4a967d76200c01371300e2c12771451e062e5cfcb36bfe4edbc0a","observation_id":"cccddb50-a740-4495-9b42-15adee25b7c5","resolution":{"observed_at":"2026-08-11T17:33:37.667394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.113943Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":"9faf2143-a64d-41f0-b862-fb64f04e22f4","year":2020},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.672685Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:6158913c6c7b557cfaeeca8b4feb8c58e726a95fa372c76165439fd78da348a3","observation_id":"3e162c79-8e30-482d-a879-d855d690bc2a","resolution":{"observed_at":"2026-08-11T17:33:38.120946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.096365Z","title":"Constraints penalized q-learning for safe offline reinforcement learning","venue":null,"work_id":"a18669f3-4226-456b-a8df-e5be628b75da","year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.678677Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:e0821345b16919acbe7139f4443c1a994d38bfd08e0c7d4e488a43f1b6474ac9","observation_id":"6216db71-c306-4fbf-8ee6-4d198cb6b999","resolution":{"observed_at":"2026-08-11T17:33:38.101582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.079859Z","title":"Primal-dual stochastic gradient method for convex programs with many functional constraints","venue":null,"work_id":"7fecd402-d2d0-4454-bc7d-58bce4543412","year":2020},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.684038Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:f270524b9edc7efef60b3a119bcbd1ea41d6f8f142136aa902db7393f8f0e27d","observation_id":"d0a69486-bf64-44aa-aa04-b430122cc777","resolution":{"observed_at":"2026-08-11T17:33:38.085356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14653","last_updated":"2024-07-19T20:15:00Z","snapshot_observed_at":"2026-08-16T13:32:35.802949Z","submitted_at":"2024-07-19T20:15:00Z","title":"OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2407.14653","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.14653","snapshot_observed_at":"2026-08-11T17:33:37.799089Z","title":"OASIS: Conditional Distribution Shaping for Offline Safe Reinforcement Learning","venue":"cs.LG","work_id":"882aa696-8536-4281-b93a-b1fcfa2e0342","year":2024},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.689199Z"},"links":{"cited_paper":"/paper/2407.14653","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:b4416da1022cabdb59fc9967a450fa5dc41b66e32d094128b804acde30d56780","observation_id":"9eabaaed-dbf7-44b9-86f4-8d62f22dc0ca","resolution":{"observed_at":"2026-08-11T17:33:37.808510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.062323Z","title":"Reachability constrained reinforcement learning","venue":null,"work_id":"c22e7122-31c6-4b18-836a-eb0095e68af5","year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.695599Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:d1330348d4343e1225c4dbbadbebe8bf20dd8eff9a30c9bd60ebafdf905381d0","observation_id":"0e665c63-23ba-468e-a65e-3daf84174d1d","resolution":{"observed_at":"2026-08-11T17:33:38.067425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11814","last_updated":"2022-06-17T02:39:04Z","snapshot_observed_at":"2026-08-16T16:58:11.417118Z","submitted_at":"2022-05-24T06:15:51Z","title":"Penalized Proximal Policy Optimization for Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11814","snapshot_observed_at":"2026-08-11T17:33:37.700628Z","title":"Penalized proximal policy optimization for safe reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.700628Z"},"links":{"cited_paper":"/paper/2205.11814","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:00193541696d80d87d91b92f6d13bbfb88c48dce650816b9e6a89f67824a5abc","observation_id":"8f5e93cf-c4d0-48de-afad-450c830f1720","resolution":{"observed_at":"2026-08-11T17:33:37.700628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.045190Z","title":"Evaluating model-free reinforcement learning toward safety-critical tasks","venue":null,"work_id":"804501f8-a095-46dc-b155-e68b2641b40b","year":2023},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.706021Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:a39e58554b4a6bf4af0390eceed47b1bb5c8692703a71a3d9c894f10c621f66e","observation_id":"b5486b46-e347-47f7-9837-461c07eaa0ff","resolution":{"observed_at":"2026-08-11T17:33:38.050910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:38.028518Z","title":"First order constrained optimization in policy space","venue":null,"work_id":"a47a423f-a699-4093-ad00-ed01b8b8c949","year":2020},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.711703Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:5885536b9ffe50adc72ace86f7b8137b7ea03a84df12e536085113f86f7442b0","observation_id":"da699856-f6a8-4d7e-b7eb-eca65762b5af","resolution":{"observed_at":"2026-08-11T17:33:38.034039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10700","last_updated":"2024-01-19T14:05:09Z","snapshot_observed_at":"2026-08-19T18:15:33.231718Z","submitted_at":"2024-01-19T14:05:09Z","title":"Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10700","snapshot_observed_at":"2026-08-11T17:33:37.716533Z","title":"Safe offline reinforcement learning with feasibility-guided diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.716533Z"},"links":{"cited_paper":"/paper/2401.10700","citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:8a25e3f25aad1f0ba68d6ed462723b09f73589f339d91e87959db956d6a1ea51","observation_id":"b59b261b-3528-4132-90d9-c51b8f8f0880","resolution":{"observed_at":"2026-08-11T17:33:37.716533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:33:37.721942Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T17:33:37.721942Z"},"links":{"citing_paper":"/paper/2412.08880"},"observation_digest":"sha256:487ae24e9ef2927d07877e0709b02b87cd6d722127e011b34f61a6b157464f6f","observation_id":"0dc13ffc-13f9-44e5-94dc-f1d0ab8f545c","resolution":{"observed_at":"2026-08-11T17:33:37.721942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08880","last_updated":"2024-12-12T02:28:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T19:23:57.317226Z","submitted_at":"2024-12-12T02:28:50Z","title":"FAWAC: Feasibility Informed Advantage Weighted Regression for Persistent Safety in Offline Reinforcement Learning"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2412.08880."}