{"as_of":"2026-08-16T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03b0bf354e8072faac7cf19ee3f193f14231df4f9fa94a1bb0b09c79c2fea8f9","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:20:56.545141Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11138/citation-record","integrity":"/paper/2412.11138/integrity","json":"/paper/2412.11138/citation-record.json","paper":"/paper/2412.11138"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.249835Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.249835Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:233c5838161925730ea9326f994ecee6ebe47a18e05bdf736f606e6b43935516","observation_id":"f0800d1b-1221-4dde-9f03-2fb971020bf8","resolution":{"observed_at":"2026-08-11T15:20:56.249835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.456551Z","title":"Constrained policy optimization, 2017","venue":null,"work_id":"d837aa24-7ea2-400f-8c1c-e2973c3a54b0","year":2017},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.255303Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:140770dff27ea4c13d109aa07aa0082e66d0010e9f3c918a6dd7353a4212ffce","observation_id":"a360c338-1592-4384-8cbe-68d871306fc0","resolution":{"observed_at":"2026-08-11T15:20:57.460464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.442908Z","title":"Constrained Markov decision processes, volume 7","venue":null,"work_id":"b9470376-1e1a-4258-b403-1517a5728be2","year":1999},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.260145Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:0e3ab102494a4081e7d753ca3c0252db2cb4d04f1d062a534274a4d7e835ad5a","observation_id":"a71c32c2-d606-4952-b20a-8bda488a1571","resolution":{"observed_at":"2026-08-11T15:20:57.446656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09802","last_updated":"2022-02-06T08:59:29Z","snapshot_observed_at":"2026-08-11T17:30:20.448429Z","submitted_at":"2022-01-24T17:02:22Z","title":"Constrained Policy Optimization via Bayesian World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09802","snapshot_observed_at":"2026-08-11T15:20:56.263978Z","title":"Constrained policy optimization via bayesian world models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.263978Z"},"links":{"cited_paper":"/paper/2201.09802","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:44706ba7e6875b8a1fef6b2286b80102f54a37a2a8a9fd14db478e5bfe32674c","observation_id":"d9d7241f-bd17-43b4-910c-2346b9547840","resolution":{"observed_at":"2026-08-11T15:20:56.263978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.427843Z","title":"Robots that interact with humans: a review of safety technologies and standards","venue":null,"work_id":"e29f34ef-5452-4e18-88e8-8ebc9c824c7d","year":2017},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.269227Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e86a1af95a1f4c91d1f42dc9fcc9c2bb7e14e1c2aa25c55470053f274b3d52f2","observation_id":"b5b70bcd-f0d2-40d2-b46a-593fd00d3b87","resolution":{"observed_at":"2026-08-11T15:20:57.433993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.273249Z","title":"Risk-constrained reinforcement learning with percentile risk criteria","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.273249Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:71acfb25d89a1faba281dd83af3c699c3ea8f419b68373856b2fac908d895e92","observation_id":"cc377145-760d-4253-b4b2-f0818b5ed36c","resolution":{"observed_at":"2026-08-11T15:20:56.273249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08068","last_updated":"2020-05-16T19:18:10Z","snapshot_observed_at":"2026-08-11T00:03:43.916025Z","submitted_at":"2020-05-16T19:18:10Z","title":"Model-Augmented Actor-Critic: Backpropagating through Paths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08068","snapshot_observed_at":"2026-08-11T15:20:56.278127Z","title":"Model-augmented actor-critic: Backpropagating through paths","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.278127Z"},"links":{"cited_paper":"/paper/2005.08068","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:72a584161466dd575bd06adc38dbf614d0be6479ba19da30b12d4b1c33965cfc","observation_id":"feb4e2bc-1b61-424a-980b-d7003ef5fec4","resolution":{"observed_at":"2026-08-11T15:20:56.278127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.404420Z","title":"Augmented proximal policy optimization for safe reinforcement learning","venue":null,"work_id":"bf61980c-8ebb-49aa-a83d-458fea657d50","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.283465Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:6c8f0e59bc7beaeb14359340ad56d6197e43e522d726506b10954586b6ff7d68","observation_id":"940c8509-2d63-4ecf-9739-8d5275988a23","resolution":{"observed_at":"2026-08-11T15:20:57.408861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.290448Z","title":"Safe RLHF : Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.290448Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e35b760cafa2075a9a0f4de992a76f1a2ed17cab7efb44148f3b09123df43432","observation_id":"fa0132e8-2c18-4e22-a256-bf12ef92e5d8","resolution":{"observed_at":"2026-08-11T15:20:56.290448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.383710Z","title":"A differentiable physics engine for deep learning in robotics","venue":null,"work_id":"58d88a02-eb56-4eb2-b6ce-47532a9de954","year":2019},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.296012Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:f368b70c008457e4613150e369be29cade395d9c5b005d3db3d58958f621a47c","observation_id":"69df94db-b3f8-4867-9d6b-23b7f539f038","resolution":{"observed_at":"2026-08-11T15:20:57.388846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.372402Z","title":"A., Farouk, H., and Mofreh, E","venue":null,"work_id":"2e51b8c2-a7bd-43ad-bd7c-5dd7344bb270","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.302087Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:02d19fba5000d70dd80bb790cd96420e7de850d001ddd52c340081ec69f59cbc","observation_id":"7e2fba4c-a9f7-4be6-bcaa-350a35f3c12b","resolution":{"observed_at":"2026-08-11T15:20:57.376244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.360740Z","title":"D., Frey, E., Raichuk, A., Girgin, S., Mordatch, I., and Bachem, O","venue":null,"work_id":"6270066f-165f-43d6-acd6-8411c2d1a8e5","year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.306751Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:5b35e4a1f79c0ba3f23e0ae559108129cb17ef362d7c771f6f954b5670ff63c9","observation_id":"7ec16299-e684-4742-9a86-ad0a989acecd","resolution":{"observed_at":"2026-08-11T15:20:57.364745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11633-022-1395-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.593546Z","title":"A Review and Outlook on Predictive Cruise Control of Vehicles and Typical Applications Under Cloud Control System","venue":null,"work_id":"da0e51e5-bfa3-469d-81ee-5c4139518375","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.311323Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:1badc38c2632c96e36698e3cbe075ea36338ba28df30664d571af6e716759235","observation_id":"998678a0-0f6a-4dc2-8e83-c9718926bce9","resolution":{"observed_at":"2026-08-11T15:20:56.597981Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.318141Z","title":"and Fern \\'a ndez, F","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.318141Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:8ffc7fe13fc25dc2ccece9fd482f77f37412a3021e6df6c691774ac3fe5ec6ba","observation_id":"6da0f8c1-27d8-4aa7-8fb6-e54e96503af9","resolution":{"observed_at":"2026-08-11T15:20:56.318141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.341359Z","title":"Bullet-safety-gym: A framework for constrained reinforcement learning","venue":null,"work_id":"f49e1e14-244f-4276-a700-6faf758f5247","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.322058Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:03e9646e37cb2032b2543739cd9975e1c81708dc49f63225c5601b82980929a9","observation_id":"2c72b972-cdd9-4fbb-9475-3d4fc74d445a","resolution":{"observed_at":"2026-08-11T15:20:57.345538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.329222Z","title":"and Bhatnagar, S","venue":null,"work_id":"760914e5-a6ba-4c96-b094-eb8814f7fcd3","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.327290Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:0278d2603149c4d7ddda776acab8621b58ff0e989001879621acc33b7e6454a1","observation_id":"2bc3246a-e9f7-4e8a-9fbe-5c0dc54e1b5d","resolution":{"observed_at":"2026-08-11T15:20:57.333323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.309030Z","title":"Personalized robotic control via constrained multi-objective reinforcement learning","venue":null,"work_id":"21d833b4-3a0a-4e95-bc93-a01934c22d1c","year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.331700Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:8ca57c25869dd12b169a4465de46e0378600c38942a685976d1103159b2d212f","observation_id":"af741505-959b-40aa-86ed-88620819c127","resolution":{"observed_at":"2026-08-11T15:20:57.314490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00806","last_updated":"2025-08-26T17:27:30Z","snapshot_observed_at":"2026-08-14T09:40:05.091946Z","submitted_at":"2022-03-02T00:56:23Z","title":"Dojo: A Differentiable Physics Engine for Robotics","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.00806","snapshot_observed_at":"2026-08-11T15:20:56.336180Z","title":"A., Cleac'h, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.336180Z"},"links":{"cited_paper":"/paper/2203.00806","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:73482fc80f5ed84636f028a295931a412de0a357801091d8a23a1a2edee76507","observation_id":"dd8f973c-9032-4d22-a699-aebf289f3952","resolution":{"observed_at":"2026-08-11T15:20:56.336180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.282088Z","title":"Deep differentiable reinforcement learning and optimal trading","venue":null,"work_id":"834c0f9e-b5f2-4ab7-b2bb-30a509616c47","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.341108Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:0dcb6a1d6344099511d4bb2164898e75ce20977b5f59b7dd447189c459147288","observation_id":"542a055a-db30-4c96-9c4f-51a54f4500b6","resolution":{"observed_at":"2026-08-11T15:20:57.287611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19852","last_updated":"2025-04-04T11:14:49Z","snapshot_observed_at":"2026-08-05T20:02:35.087707Z","submitted_at":"2023-10-30T15:52:15Z","title":"AI Alignment: A Comprehensive Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19852","snapshot_observed_at":"2026-08-11T15:20:56.344908Z","title":"Ai alignment: A comprehensive survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.344908Z"},"links":{"cited_paper":"/paper/2310.19852","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:86c33b99f0648ff3c8979528b6bdd2082f73cf051589a6d4e27464ef1c0538a1","observation_id":"d9df688e-ce39-4a8d-8168-6830c17bb556","resolution":{"observed_at":"2026-08-11T15:20:56.344908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12567","last_updated":"2024-10-06T15:42:14Z","snapshot_observed_at":"2026-08-13T10:54:00.397306Z","submitted_at":"2023-10-19T08:19:28Z","title":"Safety-Gymnasium: A Unified Safe Reinforcement Learning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12567","snapshot_observed_at":"2026-08-11T15:20:56.349062Z","title":"Safety-gymnasium: A unified safe reinforcement learning benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.349062Z"},"links":{"cited_paper":"/paper/2310.12567","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:c736a16991e835e93deeec071ed8608850055f13aa587126d2179012e5990f29","observation_id":"bbb0b150-bbd1-441f-988a-92c973798b93","resolution":{"observed_at":"2026-08-11T15:20:56.349062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09304","last_updated":"2023-05-16T09:22:14Z","snapshot_observed_at":"2026-08-13T11:41:50.164846Z","submitted_at":"2023-05-16T09:22:14Z","title":"OmniSafe: An Infrastructure for Accelerating Safe Reinforcement Learning Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09304","snapshot_observed_at":"2026-08-11T15:20:56.353163Z","title":"Omnisafe: An infrastructure for accelerating safe reinforcement learning research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.353163Z"},"links":{"cited_paper":"/paper/2305.09304","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:b2f033938645e9548be9213126af08d1a5ecb4e4711cb941e386fffeb9f1f280","observation_id":"b1796f7d-c120-452b-b1a1-62d0045df476","resolution":{"observed_at":"2026-08-11T15:20:56.353163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02416","last_updated":"2024-11-02T10:01:38Z","snapshot_observed_at":"2026-08-14T08:46:25.186464Z","submitted_at":"2024-02-04T09:24:51Z","title":"Aligner: Efficient Alignment by Learning to Correct","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02416","snapshot_observed_at":"2026-08-11T15:20:56.357555Z","title":"Aligner: Achieving efficient alignment through weak-to-strong correction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.357555Z"},"links":{"cited_paper":"/paper/2402.02416","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:a843dead4da280fef2593980d1fec0bf5fe664caaab2b44e4c030c6109db300b","observation_id":"fe97cd66-6674-40cc-8114-c2d85b8c6e79","resolution":{"observed_at":"2026-08-11T15:20:56.357555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.268903Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":"aa4d1a2f-cd54-4b4a-a0f2-03f32e4eb252","year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.361653Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:1b20f76b1707d7a49e48a265d344a2857b095f492e0808131ae42e3c25e23c12","observation_id":"ffc5257a-0570-4ec5-a019-8bb2b1a35488","resolution":{"observed_at":"2026-08-11T15:20:57.273181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.257778Z","title":null,"venue":null,"work_id":"bc905358-5c73-4772-a3f6-5ae7898e5e6e","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.365601Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:4a7e0931688a340c7bc8f6fab1e1ca1dd276ab48aa8e09ad4fbe99b0469fdc7b","observation_id":"0c3ca86f-84c8-49a4-a559-a0d2e92c2df0","resolution":{"observed_at":"2026-08-11T15:20:57.261362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.246011Z","title":"and Langford, J","venue":null,"work_id":"67693925-d829-46c3-894f-0fc596c9e655","year":2002},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.369026Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:f7510e8e79aa736f50223f21f1b6c7fe32810643adbfd34e9dc4803b43946543","observation_id":"1cbd7cbe-0eea-4de5-b983-a42d7b8e4fea","resolution":{"observed_at":"2026-08-11T15:20:57.249699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.234180Z","title":"C., Jain, R., and Nuzzo, P","venue":null,"work_id":"50d43103-c26e-4a38-8b6c-f743186ee9b3","year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.372814Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e5d1df2a7ce7dc432551f48f3ed8cc592ce4e17602e5b1b753c1126fa9d35fac","observation_id":"ef741c55-a3d1-444e-949e-cf7bdb033418","resolution":{"observed_at":"2026-08-11T15:20:57.238206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.220325Z","title":"Reparameterization gradient for non-differentiable models","venue":null,"work_id":"a8be04bd-3ec3-476c-93d3-d098b2d2428c","year":2018},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.376100Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:838abdcb308a535b37589be07040d9a66eb5ef314640f4557c1063a8e82d2727","observation_id":"305c086e-6476-4c01-a751-90a7ed9ea8bc","resolution":{"observed_at":"2026-08-11T15:20:57.225583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.379471Z","title":"Constrained variational policy optimization for safe reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.379471Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:daf56fddcb523cea44a5dbfc67ac70eba7bc499a06675044aa2ce468a770b668","observation_id":"376d8cbb-5fde-4d28-bcf4-32f3a7da07f5","resolution":{"observed_at":"2026-08-11T15:20:56.379471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.383211Z","title":"An off-policy trust region policy optimization method with monotonic improvement guarantee for deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.383211Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7a0a29a419653be001b410d2a4b4a16f05f06fb8669d77268d8b21a0d5b3d5e4","observation_id":"c807d510-2679-498a-a0dd-ba2240b1b7dd","resolution":{"observed_at":"2026-08-11T15:20:56.383211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.05803","last_updated":"2022-01-21T02:07:54Z","snapshot_observed_at":"2026-08-13T17:36:00.116759Z","submitted_at":"2021-11-10T16:51:04Z","title":"Gradients are Not All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.05803","snapshot_observed_at":"2026-08-11T15:20:56.386945Z","title":"D., Schoenholz, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.386945Z"},"links":{"cited_paper":"/paper/2111.05803","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:b2ef7200847e59629d50f6bee68381eef7d7dded22839dad113864b1e895b902","observation_id":"cbd0547a-70e9-47d5-906c-7bfe07d721c8","resolution":{"observed_at":"2026-08-11T15:20:56.386945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.199692Z","title":"Monte carlo gradient estimation in machine learning","venue":null,"work_id":"c19b8db9-d50e-4ba0-b4b2-f673c97ccbda","year":2020},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.390858Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:26ac6a2d53f14511f60639190a557b4c45179d4cc7e122a6d56a0d576a3f1303","observation_id":"2bc24076-c5a0-407f-b5b7-b541570fd9c8","resolution":{"observed_at":"2026-08-11T15:20:57.204095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.187226Z","title":null,"venue":null,"work_id":"45ae3364-a5b1-44fc-9e61-13cb14b33d4a","year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.394340Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:d7f3731446bd956b914747df61bc55680226625f7c8174028d7a878326c7128f","observation_id":"49bd8828-605e-4244-a788-311f55409221","resolution":{"observed_at":"2026-08-11T15:20:57.191282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.174252Z","title":"A focused backpropagation algorithm for temporal pattern recognition","venue":null,"work_id":"f73215cd-4221-41f8-a1c5-3d7a3fdf648e","year":1995},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.398561Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7399ac5ddbc3bdb1b2c1f570813af8aa413b2a68a23da90b01347112fd8aa959","observation_id":"7acdd6df-4a9a-4ef2-bff5-8f5a322e9b8b","resolution":{"observed_at":"2026-08-11T15:20:57.178946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.161165Z","title":null,"venue":null,"work_id":"224d1b82-83d3-4c68-a319-6d8aba9d5822","year":2013},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.403481Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:77c44c4a65f6bf2a781f6bb21e3fd6b1b2810e1f76f0999d7986444710854337","observation_id":"a63348ae-db32-4cce-ab11-1df098d90384","resolution":{"observed_at":"2026-08-11T15:20:57.165377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.144840Z","title":null,"venue":null,"work_id":"8b0b21b8-3657-4fdd-89bf-f452f21c7979","year":2020},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.407548Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:01b966e41f7f58f40139115cb997f2e46942507b368fdefd55f24e11446d2867","observation_id":"cbbc98fb-67aa-411f-bb0a-9dd7e69882c8","resolution":{"observed_at":"2026-08-11T15:20:57.151741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ifacol.2017.08.1649","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.577854Z","title":"Trajectory planning with miscellaneous safety critical zones**this work was supported by ffi - strategic vehicle research and innovation","venue":null,"work_id":"c9d42335-d1e5-4995-bd48-ee47d96ac9e4","year":2017},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.412556Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e9248326089aab458bceb2d479a47264bdb5c11364e2ae4e6450b03722edf483","observation_id":"bf742935-2efa-4048-97d0-0bba24bf954d","resolution":{"observed_at":"2026-08-11T15:20:56.584281Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.130063Z","title":"M., Smaby, N., and Cutkosky, M","venue":null,"work_id":"4e2048b9-9293-4265-88f9-d5b18c0f9d63","year":2000},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.418519Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:b470e5c6d48e1cca1a5fb275d0a12fef8de6d32ec14e802f4a3956c5c962988b","observation_id":"c1761bfb-2b04-466e-9cb2-61bcc64c4769","resolution":{"observed_at":"2026-08-11T15:20:57.134741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.423648Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.423648Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e6a78c07e58c5fe642c83eeaa0e07af7ea753d4ce77d4a4e496e29823ca07355","observation_id":"712e9719-cd9b-4042-80e5-8bb490350a44","resolution":{"observed_at":"2026-08-11T15:20:56.423648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.107645Z","title":"Model-based reinforcement learning with scalable composite policy gradient estimators","venue":null,"work_id":"c33e0ea1-3eb8-413b-9c23-fc873ffa9e94","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.432253Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7c2ac6f5aa69118bc10ad10485acc81fced923398406b5e167ced75fbc45c242","observation_id":"139bfd47-8804-48ff-9cb5-13faf20c5b9b","resolution":{"observed_at":"2026-08-11T15:20:57.112583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.090782Z","title":"Model-based reinforcement learning with scalable composite policy gradient estimators","venue":null,"work_id":"cd02f067-fcbf-4e6d-bdc1-0fff6ee7c26f","year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.437224Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:ccde8fcd552cc4532c0bf0e5fd196ed38d8e1a3728121c37e0b503941a2e9ac2","observation_id":"3114b496-2514-448b-852b-9f77beb9670a","resolution":{"observed_at":"2026-08-11T15:20:57.095465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.078761Z","title":"and Barr, A","venue":null,"work_id":"7408bb2d-b14f-4d1a-9794-5c800c5941a5","year":1987},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.441781Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:8ab4a23697e30419b0c6168bdaa01d88f37be19a067a0856162c1b4668558229","observation_id":"633aab94-066a-433e-8a49-dcfaa483f501","resolution":{"observed_at":"2026-08-11T15:20:57.082293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.062637Z","title":"E., Perescu-Popescu, L., and Mastorakis, N","venue":null,"work_id":"6a10a5eb-4a99-48fe-a946-679cea39a756","year":2009},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.446967Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:f350098713d4f82cb123a7507f9bb012bc92ebb9016464c11b1645dc1c26d86b","observation_id":"682a5e1f-371a-4840-b23b-9977cfb85249","resolution":{"observed_at":"2026-08-11T15:20:57.067430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.451697Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.451697Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:92d89ed11718cb1141266582391270a12027895c0966cfdde0b4712f55209bbb","observation_id":"efaa3de5-6dd0-45e0-9e11-2630796a9d4a","resolution":{"observed_at":"2026-08-11T15:20:56.451697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.456035Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.456035Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:0030065b4ae9d909f8058916285de6af3e5ab76320e9f7e18869bbade11795f4","observation_id":"d5a0be68-f149-4d2b-a9ca-6fb830cd6854","resolution":{"observed_at":"2026-08-11T15:20:56.456035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-11T15:20:56.460994Z","title":"D., and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.460994Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9f367ba02edbcf456ef4cb4da459f119a7df5b5facba4b961658d143c9dda9ae","observation_id":"5af2260d-6e97-4eb8-8543-0fd2555934bb","resolution":{"observed_at":"2026-08-11T15:20:56.460994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-14T05:35:42.838302Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-11T15:20:56.465505Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.465505Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:9288e922e47110add76816c49a7bb67a5a034a6c5ff05d1c88da1803bc704b70","observation_id":"4cb0e4ea-7af1-4b76-bb84-fdafd028042e","resolution":{"observed_at":"2026-08-11T15:20:56.465505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.470091Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.470091Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7e50d5021304d2048d1fa97aec139bed7b4f21fd8ea16adcfe2b9d46115bbf27","observation_id":"3a617aa4-eb65-40b0-9b18-09692828d39e","resolution":{"observed_at":"2026-08-11T15:20:56.470091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07237","last_updated":"2019-05-17T14:36:48Z","snapshot_observed_at":"2026-08-14T16:30:39.066753Z","submitted_at":"2019-05-17T14:36:48Z","title":"TBQ($\\sigma$): Improving Efficiency of Trace Utilization for Off-Policy Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1905.07237","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.07237","snapshot_observed_at":"2026-08-11T15:20:56.672235Z","title":"TBQ($\\sigma$): Improving Efficiency of Trace Utilization for Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"78eacdd0-fec3-4231-a63e-819cc96b44b8","year":2019},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.473886Z"},"links":{"cited_paper":"/paper/1905.07237","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:4dab39639a55e8196605d2ffee41d675b246a5c005dae56e9c6c42d34d387d0a","observation_id":"30eb5d28-521f-42c7-9a2d-90b69df97748","resolution":{"observed_at":"2026-08-11T15:20:56.676622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.478429Z","title":"J., Guez, A., Sifre, L., Van Den Driessche, G., Schrittwieser, J., Antonoglou, I., Panneershelvam, V., Lanctot, M., et al","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.478429Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:99106c2e9f90e05eafa32a177de77b263b98d5c9ddd8013206a67151f73a5305","observation_id":"2164f7e4-e74d-4d9f-9cc3-e67046c62bb1","resolution":{"observed_at":"2026-08-11T15:20:56.478429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.482832Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.482832Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:7ff908930d0514e2bda437d9c4cbf8a4aaa05758734058d86f33fc7996c2c268","observation_id":"5d2a9931-94a1-4178-8e73-2206990cc789","resolution":{"observed_at":"2026-08-11T15:20:56.482832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:57.004394Z","title":null,"venue":null,"work_id":"61d57097-1d3d-454c-9253-8e2949f5d00d","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.486674Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:955e57ec71a7128fa2546fa1c6fb7dc6d384d599a42897a78a0d36f5e8f49435","observation_id":"e4475aa1-6272-45d6-8567-4328e096c74f","resolution":{"observed_at":"2026-08-11T15:20:57.008450Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.989525Z","title":"Responsive safety in reinforcement learning by pid lagrangian methods","venue":null,"work_id":"9b588d61-49b5-4a4d-8837-c766eb53a9fc","year":2020},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.490259Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:e49f0489b35ab26dc6523df5372833d5be101bd56fa3d53a6f8f43d8f184d5ea","observation_id":"3b87282a-bebf-4bd3-99f1-0c0868e88f05","resolution":{"observed_at":"2026-08-11T15:20:56.994990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.974959Z","title":"J., Simchowitz, M., Zhang, K., and Tedrake, R","venue":null,"work_id":"91549635-00f4-48e7-ae4e-5f78e6f542dd","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.494887Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:d3dc5ec389efaca4ef5bed4738896b213150df834c217634ab18e7f74baec9c8","observation_id":"70b62e8d-cedb-4af6-9ad0-e4ab9cc69157","resolution":{"observed_at":"2026-08-11T15:20:56.980047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.499664Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.499664Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:083b25f93efc87e6605c36e3e7bfbb797a8e7fb79a92b15b2efc435fa5f7bc37","observation_id":"b60e1a78-6ea9-4152-85f0-a6a952922a4b","resolution":{"observed_at":"2026-08-11T15:20:56.499664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.952436Z","title":"W., Wang, T., Shang, Y., and Wu, Z","venue":null,"work_id":"2b1afb2b-1fbe-4c4b-8107-711d13241288","year":2000},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.505091Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:547f850ffb76d196474c5e426d1444d49b90592fd39b81bdca93f1d3d717b796","observation_id":"f5a7f6ff-f92e-4263-875e-631c4c3bad3c","resolution":{"observed_at":"2026-08-11T15:20:56.956471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.939756Z","title":"Development of a humanoid robot control system based on ar-bci and slam navigation","venue":null,"work_id":"7fbb9a01-9329-4443-9da8-b8954c8aae06","year":2024},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.509463Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:63dadc34d3b569564bd9174cf637a317f45fb87b7f2e97ee5139409322f36b40","observation_id":"a320c451-bbe7-4f3a-b23b-6681bab8ddc3","resolution":{"observed_at":"2026-08-11T15:20:56.943923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.927072Z","title":null,"venue":null,"work_id":"16c4e955-8c44-486c-9d66-df6bf6ed663a","year":2021},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.515075Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:d569d2cb76219c191348a7cc903272f74960d785a21018fb6f28ede6e26982eb","observation_id":"cd42231a-daa8-4f4a-9662-c64b4836664a","resolution":{"observed_at":"2026-08-11T15:20:56.931716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02346","last_updated":"2023-03-04T07:24:22Z","snapshot_observed_at":"2026-08-13T12:32:16.521602Z","submitted_at":"2023-03-04T07:24:22Z","title":"FluidLab: A Differentiable Environment for Benchmarking Complex Fluid Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02346","snapshot_observed_at":"2026-08-11T15:20:56.521513Z","title":"Fluidlab: A differentiable environment for benchmarking complex fluid manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.521513Z"},"links":{"cited_paper":"/paper/2303.02346","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:24954711a64060017cd64959632875eeca5daf2ac3e27dfbcd5684902fd9ae10","observation_id":"39328285-6824-4b56-97bc-6b1ea74a029b","resolution":{"observed_at":"2026-08-11T15:20:56.521513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08025","last_updated":"2022-09-16T16:10:08Z","snapshot_observed_at":"2026-08-13T14:25:00.468330Z","submitted_at":"2022-09-16T16:10:08Z","title":"Trustworthy Reinforcement Learning Against Intrinsic Vulnerabilities: Robustness, Safety, and Generalizability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.08025","snapshot_observed_at":"2026-08-11T15:20:56.526507Z","title":"Trustworthy reinforcement learning against intrinsic vulnerabilities: Robustness, safety, and generalizability","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.526507Z"},"links":{"cited_paper":"/paper/2209.08025","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:f86c4da604d0c8f48bd75d0fcd5c6c82b986e0f1f1d9399ebb2afd8141da0093","observation_id":"9f83f98c-d743-4be3-8402-224876a928a8","resolution":{"observed_at":"2026-08-11T15:20:56.526507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.03171","last_updated":"2018-02-09T08:46:21Z","snapshot_observed_at":"2026-08-14T19:47:26.393250Z","submitted_at":"2018-02-09T08:46:21Z","title":"A Unified Approach for Multi-step Temporal-Difference Learning with Eligibility Traces in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1802.03171","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.03171","snapshot_observed_at":"2026-08-11T15:20:56.626771Z","title":"A Unified Approach for Multi-step Temporal-Difference Learning with Eligibility Traces in Reinforcement Learning","venue":"cs.AI","work_id":"cbb82359-353f-46ee-8978-7c30ba893cea","year":2018},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.531090Z"},"links":{"cited_paper":"/paper/1802.03171","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:6571170e39e4eaf86d4eaa4dcab8745557db8768b14609fb20778d512d010600","observation_id":"1df34a0f-ee63-4136-a3d1-302b68d056d5","resolution":{"observed_at":"2026-08-11T15:20:56.632413Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.912610Z","title":"Constrained update projection approach to safe policy optimization","venue":null,"work_id":"5c46a6f6-74cb-4a6a-a305-df2d0a27efe5","year":2022},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.536115Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:a83de96336438dd9ea2cfb96131de9584403d710f0283c5a3a436b226b70ee7b","observation_id":"73e89b4b-0b3d-413f-a788-dfa37e890dae","resolution":{"observed_at":"2026-08-11T15:20:56.917830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03152","last_updated":"2020-10-07T04:22:45Z","snapshot_observed_at":"2026-08-10T08:43:44.490290Z","submitted_at":"2020-10-07T04:22:45Z","title":"Projection-Based Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03152","snapshot_observed_at":"2026-08-11T15:20:56.540973Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.540973Z"},"links":{"cited_paper":"/paper/2010.03152","citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:dd08e5f691280ab90412eeeb9913683cb3c237cd9984ed945588d27a40756475","observation_id":"f7d4c6dd-6a6a-4971-9ab3-bf5fcb76046f","resolution":{"observed_at":"2026-08-11T15:20:56.540973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:20:56.896674Z","title":"First order constrained optimization in policy space","venue":null,"work_id":"0035dea0-58f0-43af-9c9c-3efbd59bc441","year":2020},"citing_paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T15:20:56.545141Z"},"links":{"citing_paper":"/paper/2412.11138"},"observation_digest":"sha256:08287cb180392320c9323fdfdcb91d9030d4591e36abc7f481c465858e049a63","observation_id":"4b6b7e47-0add-45be-89ac-407b5fee5bee","resolution":{"observed_at":"2026-08-11T15:20:56.901732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.11138","last_updated":"2024-12-15T10:05:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T07:30:02.387836Z","submitted_at":"2024-12-15T10:05:23Z","title":"Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":4,"verified_fuzzy":28},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2412.11138."}