{"as_of":"2026-08-10T02:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a97c85f1ee08d96ae2fe009f8da298936bb63b77b8149120d8b87f9143104130","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:23:18.766484Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.20955/citation-record","integrity":"/paper/2510.20955/integrity","json":"/paper/2510.20955/citation-record.json","paper":"/paper/2510.20955"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:16.377418Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.377418Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:8b3f7788b4b251eebeb73247ad80b8ff67d112c6139e8b271224b89c4e54a13d","observation_id":"d002d5ba-f0b3-45eb-b9c1-d28f76f2ab0a","resolution":{"observed_at":"2026-08-04T08:23:16.377418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:16.450527Z","title":"Routledge, 1 edition, March 1999","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.450527Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:5db1f9a9e0f16c37854d9fa168dbe7ec1d4cfb7234cb3ed9c03058a74f614dca","observation_id":"e5679ba1-b9ca-4190-ad85-1b7305c34d1e","resolution":{"observed_at":"2026-08-04T08:23:16.450527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:16.582957Z","title":"CONSERV ATIVE SAFETY CRITICS FOR EXPLORATION","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.582957Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:1a77627178c424d7b47ee4da7136d9fbac28efc3dd2dc2c6b76aa4f84f0b5f04","observation_id":"fa6f2bd6-f182-4ac9-bf2d-4d4cf721afc1","resolution":{"observed_at":"2026-08-04T08:23:16.582957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14603","last_updated":"2020-10-27T20:53:20Z","snapshot_observed_at":"2026-07-06T10:09:10.434213Z","submitted_at":"2020-10-27T20:53:20Z","title":"Learning to be Safe: Deep RL with a Safety Critic","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14603","snapshot_observed_at":"2026-08-04T08:23:16.668291Z","title":"Learning to be Safe: Deep RL with a Safety Critic, October 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.668291Z"},"links":{"cited_paper":"/paper/2010.14603","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:d6abc51bacdd04fbf8db5c32d6fd2269d360720735b298098e14a068e98256b1","observation_id":"8e12a26a-0b8f-4316-a43e-de9d1cb365ea","resolution":{"observed_at":"2026-08-04T08:23:16.668291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10765","last_updated":"2022-10-19T17:57:24Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:57:24Z","title":"When to Ask for Help: Proactive Interventions in Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10765","snapshot_observed_at":"2026-08-04T08:23:16.784317Z","title":"When to Ask for Help: Proactive Interventions in Autonomous Reinforcement Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.784317Z"},"links":{"cited_paper":"/paper/2210.10765","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:507924a6010847107415d52b5c14486a469c914f6ffe9d1eb0f857f4d207c3d6","observation_id":"cf35bea8-2c67-4dfc-bef7-1fb15046095b","resolution":{"observed_at":"2026-08-04T08:23:16.784317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:16.953434Z","title":"Safe Exploration in Finite Markov Decision Processes with Gaussian Pro- cesses","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:16.953434Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:be7957ff82ec9df3cd1d04f1281d0760316226515c9c585a7dc26faaeaf8599d","observation_id":"12c2574e-a244-494b-af2e-738480f6f563","resolution":{"observed_at":"2026-08-04T08:23:16.953434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.06626","last_updated":"2020-08-15T02:20:23Z","snapshot_observed_at":"2026-07-06T09:47:22.472576Z","submitted_at":"2020-08-15T02:20:23Z","title":"Safe Reinforcement Learning in Constrained Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.06626","snapshot_observed_at":"2026-08-04T08:23:17.086576Z","title":"Safe Reinforcement Learning in Con- strained Markov Decision Processes, August 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.086576Z"},"links":{"cited_paper":"/paper/2008.06626","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:7368c6078e5404498bb11a00e2b5ee0f731761ccb7b3a26517c0eee9bf729a34","observation_id":"fdc35601-a69a-49eb-8b83-ff7e9319b0f3","resolution":{"observed_at":"2026-08-04T08:23:17.086576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.205448Z","title":"Safe Reinforcement Learning via Shielding.AAAI, 32(1), April 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.205448Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:8dc82efdae06a224afd76accc05ae2b307595561f50db991003a3aa3c55a5fd3","observation_id":"c6cb463e-ce38-44cc-9444-d781801f1e21","resolution":{"observed_at":"2026-08-04T08:23:17.205448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.285222Z","title":"Safe Reinforcement Learning with Nonlinear Dy- namics via Model Predictive Shielding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.285222Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:8726aec3f737b213591965ceb2f57392ffbbba1297ba5d5f539f64a4d4df931c","observation_id":"3582263d-2d16-4753-a0f0-9621a0cbf0a9","resolution":{"observed_at":"2026-08-04T08:23:17.285222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.380279Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.380279Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:2dcbc5088760550d2a53d01f47d7f644ac06bd7201e5f31e563a251e8d1c9329","observation_id":"998d193a-75b9-4e03-bd13-e9465e87a9a5","resolution":{"observed_at":"2026-08-04T08:23:17.380279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.529192Z","title":"Don’t Do Things You Can’t Undo: Reversibility Models for Generating Safe Behaviours","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.529192Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:40ff1a3df2a83760e690e4fff934d72776e570635860db73a03ff638fb1531a0","observation_id":"490d46d0-bf0f-4fc8-b93d-e41402c77adb","resolution":{"observed_at":"2026-08-04T08:23:17.529192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.672838Z","title":"Cambridge University Press, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.672838Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:1b103ab60e950126c70e54c709e755aa8757f49b1f8a9b614966a3227f44d68f","observation_id":"a9f65f6a-489d-4f6c-a1cb-a04375ead61a","resolution":{"observed_at":"2026-08-04T08:23:17.672838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.788317Z","title":"Provable Safe Reinforcement Learning with Binary Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.788317Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:889fa55fb866be4fccc5ab37fbd742f65476fafb994406b88fcfb9d351757797","observation_id":"54401f63-8d5d-4511-a70b-e178a217bf14","resolution":{"observed_at":"2026-08-04T08:23:17.788317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:17.931055Z","title":"Long- Term Safe Reinforcement Learning with Binary Feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:17.931055Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:4a362d5463554af6ce544537ba279097766fca4cb363190f795ffa6ac2847957","observation_id":"664222e5-c045-424b-a530-f2fe0d5345ba","resolution":{"observed_at":"2026-08-04T08:23:17.931055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.079016Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.079016Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:6ecf7cc8b5e9db3c0454c1d92c9ade1361b0da200d541e0e7281d0c9a4ac157a","observation_id":"264d2a0c-e579-41fc-b2b5-4d689e9e7c31","resolution":{"observed_at":"2026-08-04T08:23:18.079016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06782","last_updated":"2017-11-18T00:53:20Z","snapshot_observed_at":"2026-08-01T16:00:14.137282Z","submitted_at":"2017-11-18T00:53:20Z","title":"Leave no Trace: Learning to Reset for Safe and Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06782","snapshot_observed_at":"2026-08-04T08:23:18.222593Z","title":"Leave no Trace: Learning to Reset for Safe and Autonomous Rein- forcement Learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.222593Z"},"links":{"cited_paper":"/paper/1711.06782","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:9c24f286c41669a4b7876ea27508278c546c8e4b281c85ec6644b262f05ca123","observation_id":"8910cac7-dc28-4891-a1e6-64f93d882b89","resolution":{"observed_at":"2026-08-04T08:23:18.222593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.329391Z","title":"There is no turning back: A self-supervised approach for reversibility-aware reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.329391Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:8073dedd7c630d1e55aca2d083a7be550b06dda0925a14b2a8979fd8b766bb28","observation_id":"ecab50ad-98cc-4e6d-a1f7-812770ed790c","resolution":{"observed_at":"2026-08-04T08:23:18.329391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.446978Z","title":"Dy- namic model predictive shielding for provably safe reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.446978Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:cf8a589f8aa7992957e5bd38be29367f6f35057dfa3c464326ccd690c3e0372c","observation_id":"a2e2688b-4d2a-429b-81a7-68c283a5e5da","resolution":{"observed_at":"2026-08-04T08:23:18.446978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.535761Z","title":"Rehg, and Evangelos A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.535761Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:13acec080884572da5329385c25b836fd41f819cbe33a0dfb2a9d7e426878489","observation_id":"ea34a4fd-7ac3-40de-baf5-94c87038145f","resolution":{"observed_at":"2026-08-04T08:23:18.535761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-04T08:23:18.615603Z","title":"Gymnasium: A standard in- terface for reinforcement learning environments.arXiv preprint arXiv:2407.17032, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.615603Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:b7765d1494940a00a55e3d9fabf9c55227bcc862c7a0d488c5a0beaca6e27424","observation_id":"14589165-7326-40fa-86ab-bda16ccf679e","resolution":{"observed_at":"2026-08-04T08:23:18.615603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T08:23:18.680672Z","title":"Proximal policy optimization algorithms.ArXiv, abs/1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.680672Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:a8d1a0245a8f27d95ceac2122135304ee9f41396b58a349a44da2ab53493753c","observation_id":"ffdf6320-4555-472b-a790-9f719672b14c","resolution":{"observed_at":"2026-08-04T08:23:18.680672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:23:18.766484Z","title":"Stable-baselines3: Reliable reinforcement learning implementations.Journal of Machine Learning Research, 22(268):1–8, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:23:18.766484Z"},"links":{"citing_paper":"/paper/2510.20955"},"observation_digest":"sha256:8a0c038286d04304c48be3f9be9d02a86c9fc8e71c65b1d64e78bce05bde7f4f","observation_id":"5651fbe5-046a-4a35-b287-724bf2bbf840","resolution":{"observed_at":"2026-08-04T08:23:18.766484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.20955","last_updated":"2026-05-22T22:50:20Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T13:18:20.257262Z","submitted_at":"2025-10-23T19:31:18Z","title":"Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 0 inbound Pith citation observations for arXiv:2510.20955."}