{"as_of":"2026-08-10T10:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:09b0bf922937aa685a158c911d94fadaa42cedc93dd4c5501da1d898b0c018fb","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T05:46:03.704125Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08925/citation-record","integrity":"/paper/2607.08925/integrity","json":"/paper/2607.08925/citation-record.json","paper":"/paper/2607.08925"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Ames, Samuel Coogan, Magnus Egerstedt, Gennaro Notomista, Koushil Sreenath, and Paulo Tabuada","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:8702115b62bc2241801c97c0f4369d6706d23fd441b83ccfd1825bcc2400f456","observation_id":"3218436a-3f43-4a88-a9ef-215fee392dff","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"ISBN 9781605585161","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:7d8ccde9dc20550539e189c60efe39a96fff7bfc11d0dc53f421a29bae8066bc","observation_id":"374f5067-d0b1-4270-8333-5a612d899c26","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Safe exploration in continuous action spaces.CoRR, abs/1801.08757,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:12372f530d20db5c0b8383fb3bdf673834cf1527d848936a9b44b96a612b1945","observation_id":"1ef3ff0c-df5d-4e33-82bc-da561075d2e6","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2019.xv.011","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mohammadhosein Hasanbeig, Alessandro Abate, and Daniel Kroening","venue":null,"work_id":"5feed32e-0d04-4f2f-93b8-d722bdef088d","year":2019},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:f85b15058376dc44850de43e4e2e6f1b103649a442289e93c5c5f76dca2d95c9","observation_id":"6ff456a5-5f81-491e-a958-8b54531a3919","resolution":{"observed_at":"2026-07-13T05:49:23.740269Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:19:58.249204+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:19:58.249204+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Shengyi Huang, Rousslan Fernand Julien Dossa, Chang Ye, Jeff Braga, Dipam Chakraborty, Kinal Mehta, and Jo ao G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:dcc1a0d464c1261420a7d2519b3268363f46971d9b80af2164f35e6c2966679a","observation_id":"f32a5ce2-e4b7-44ed-9bd1-c20276b28357","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Choi, Michael Janner, Claire J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:dd2e8ff2206e439064a0eb04a4f550b39ad8e99b978de75828a2b6785df68494","observation_id":"23c698ac-9b57-4aad-8d25-47142d5a8b12","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Ashish Kumar, Zipeng Fu, Deepak Pathak, and Jitendra Malik","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:56037ce4fc81745ae224a9f711c1b0cd66df51d73c5ee808ed0c0ee5859a3025","observation_id":"561d899a-c361-4a7d-a6b1-30e1e74cffbe","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07517","last_updated":"2019-01-22T18:45:42Z","snapshot_observed_at":"2026-08-09T19:28:04.592317Z","submitted_at":"2019-01-22T18:45:42Z","title":"Robust Recovery Controller for a Quadrupedal Robot using Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1901.07517","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.07517","snapshot_observed_at":"2026-07-13T05:49:23.733820Z","title":"Robust Recovery Controller for a Quadrupedal Robot using Deep Reinforcement Learning","venue":"cs.RO","work_id":"fb957c62-7553-42bd-b9e5-8c7191b5cd6e","year":2019},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/1901.07517","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:4f503d3144018949cfcbbd4e225beac432a9e7fb4a7593c379e195c50e448d8e","observation_id":"66ea9a09-f858-46da-b009-5dc576c9b0d3","resolution":{"observed_at":"2026-07-13T05:49:23.735751Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Sanmit Narvekar, Bei Peng, Matteo Leonetti, Jivko Sinapov, Matthew E","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:3624774619e0b9848bbb789f4b4b018bb0581d4834558586896e82383f328e5d","observation_id":"358108df-7596-4570-8fd8-9900570da405","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Xue Bin Peng, Erwin Coumans, Tingnan Zhang, Tsang-Wei Edward Lee, Jie Tan, and Sergey Levine","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:9c198e90162264bc6822f3831eda3d84a8db24d0731771c43fc7b68eaf0efc45","observation_id":"dccd144d-696a-4a93-96b5-cab7972b1249","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Xun Pua and Majid Khadiv","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:27563516f3caf9c9ff772ec27c937c963ea529fe1813b787c938040217ae96c1","observation_id":"2f8ac172-9061-47f4-a0bf-f0aaad2a9e55","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/humanoids58906","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:49:23.730844Z","title":"2024.10769799","venue":null,"work_id":"8b822184-e294-454a-8b4b-9dcf948906e2","year":2024},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:5af3dbea6d127e92abe9bfceb6ae5376ecffc3dc9c218443f033ea9bf9f9cd12","observation_id":"074112a7-aa09-4956-887b-1a17c04d10ff","resolution":{"observed_at":"2026-07-13T05:49:23.732396Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:19:59.963935+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:19:59.963935+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Learning to walk in minutes using massively parallel deep reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:bde1fd21f66f1110a695b2dcd6807de74040ff6b14a8d56db8a3b22bea4fadff","observation_id":"61f99978-a860-4a60-828d-9d1ff0eeb965","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Trial without error: Towards safe reinforcement learning via human intervention","venue":null,"work_id":null,"year":2067},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:4a46b61b7723bf9539453ee92141dddb96fc07faa350147fbc11130d941bc984","observation_id":"7f1f459e-8eb2-4ee1-a0ac-7e6defe77733","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Proximal policy optimiza- tion algorithms.CoRR, abs/1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:11addd5a91ea570122e2da4049b099fa87b21c514cffd528b36f4ec461ef5163","observation_id":"258d8482-dc10-4668-9ef7-1a446d1fb73c","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2023.xix.051","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, J","venue":null,"work_id":"655d3322-8e18-4dc4-bdc0-8009b3c600f8","year":2023},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:acb5acb88c39f1f20b4246f7eb9cd182f0efd516d6af667289ee851adc612bf4","observation_id":"71ae7c4e-07b1-4d91-9455-667a6c5dbe44","resolution":{"observed_at":"2026-07-13T05:49:23.761511Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:20:00.222498+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:20:00.222498+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14603","last_updated":"2020-10-27T20:53:20Z","snapshot_observed_at":"2026-07-06T10:09:10.434213Z","submitted_at":"2020-10-27T20:53:20Z","title":"Learning to be Safe: Deep RL with a Safety Critic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14603","snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Learning to be safe: Deep RL with a safety critic.CoRR, abs/2010.14603,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/2010.14603","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:29a0b9ea9491f871480729925a3354776977a6191170ffebc4030289cf92cab0","observation_id":"47bd04e3-9676-486c-956f-e380a6bf15f0","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Sim-to-real: Learning agile locomotion for quadruped robots","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:f37eb17fd33ced6b4465f81d6d9f2e275415870dadf5b9c59cf325defd0a87e5","observation_id":"6fbf0afc-f137-487a-8e8e-33a50aeca87e","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-07T08:33:38.128537Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Chen Tessler, Daniel J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:0aa474d6b0f7388b09fcf2e0b3cb083372bc46e40672a537ff8a63877fc52bdc","observation_id":"a91ff146-8d42-498a-bb9e-1893a6f293b2","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Emanuel Todorov, Tom Erez, and Yuval Tassa","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:299bd1f1c0de865546894accd2f3be4fadaaf38bb1a164e0f3ba4feac68703c2","observation_id":"56cdc0bd-9fc4-48a2-a58c-b8b6cc9060b6","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Mark Towers, Jordan K","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:89059f1574a4b5cd181de8bca600459426f2e35cfd4150bcba717a19424cc3b9","observation_id":"06645f40-c119-4ad3-a0dd-57568a859669","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"URLhttps://doi.org/10.24963/ijcai.2024/913","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:3f76f11f9ad5fd261e3363a806561836adafc51e78e1ecdc8c73fba2c22f3379","observation_id":"ffc01a51-20ed-4a4c-bfd2-176bcd8158ed","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Kevin Zakka, Yuval Tassa, and MuJoCo Menagerie Contributors","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:2e072d3a1f89b9e03b7037ee147f752ab1f9e65ffa9bc9844a5f86c143aaddd4","observation_id":"f6355c3b-f2b4-4c47-90bf-b0fef8aed300","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2023/763","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://doi.org/10.24963/ijcai.2023/763","venue":null,"work_id":"60a106af-052b-4d9c-9eed-10d5213ba065","year":2023},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:49fbd475711e4657d9d3a280a398d55dd3e00127ab0fe25395a0697a408f8869","observation_id":"4da7ee70-3e09-4f31-b7a0-41fbf86662a1","resolution":{"observed_at":"2026-07-13T05:49:23.749250Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:20:01.478306+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:20:01.478306+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"Clipping bounds variance downstream of the singularity rather than removing it","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:dded2bff43422335d4000a4adff97bb9ee640efdcb718fa52725dd3705790d65","observation_id":"2fe6394f-3268-4bcf-9cc2-11947860fb17","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:1648f33b09ed6ce84ff27c919344db2b52fdd25c47dff57f70294c8612f65a84","observation_id":"30d9b33d-1e35-4927-a0c1-db54f7ecacd9","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:20c1467de7fffab879fe031e226655d37380322dc9ea1ef5e3299aa84d428974","observation_id":"7879240e-bc99-45df-b474-a43106d4cbba","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:a973282fb0b9ba9799f3bd1f9ba8e21b4de2450b0de536a75bb8e6d02c6eff7e","observation_id":"281778e4-fe75-4cbe-b09f-56f2c4bb271f","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"CPO and PPO-Lagrangian additionally carry the constraint hyperparameters their objective requires (Section C.3)","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:563f354a9059f1a4cc5dc82aff071ed580e1a4bac19867a84c4b026b35f0a6fe","observation_id":"9722ad14-7b7e-44dd-89cf-5a72673eead8","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:016ae4602541d339d372f117fdd0e1165413053c3f2bb3a2d955a47f94eadbde","observation_id":"36000acf-9365-4be8-a4b0-19692dbfcb5d","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:4b2827502445e3d23a3249ac2c88d2fd953eb5f3b9d056a251347d26b856b047","observation_id":"5209fcc6-7cba-41d5-8ac8-b87faf89dc3e","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":"global”). An alternative “per-segment","venue":null,"work_id":null,"year":2044},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:9530bb5619d721b85716f372dc90b6b3600e3dad8bb99c269ffc6ac7a7c857de","observation_id":"ea2c3ada-c1ea-42b8-a5d1-ffe5a9adc628","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:f2e77ef5811181c2cbf0f14c6e51d943da1eb69c2f9ab679f22e36a6e7fba4ad","observation_id":"b2ce74f8-3002-4757-8960-f03e60a71d89","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T05:46:03.704125Z","title":null,"venue":null,"work_id":null,"year":2066},"citing_paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T05:46:03.704125Z"},"links":{"citing_paper":"/paper/2607.08925"},"observation_digest":"sha256:66605a2ca21932ffa524cfd45e93277963d0327697c72565b314013ddda41f65","observation_id":"a347c806-4456-4019-bf06-729146d76549","resolution":{"observed_at":"2026-07-13T05:46:03.704125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08925","last_updated":"2026-07-09T20:41:45Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T19:27:52.976453Z","submitted_at":"2026-07-09T20:41:45Z","title":"SafeExplorer: An Unbiased Policy Gradient for Reinforcement Learning with Recovery Interventions"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.08925."}