{"as_of":"2026-08-10T05:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01d52de07f4a6c665d6b19d1b3fd6e4bcf834c29bca07a4dad065f833a95d783","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:30:26.255011Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21852/citation-record","integrity":"/paper/2505.21852/integrity","json":"/paper/2505.21852/citation-record.json","paper":"/paper/2505.21852"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.794681Z","title":"Achiam, D","venue":null,"work_id":"bc6b0d53-3c47-4ced-9453-96ddd2c226f6","year":2017},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.727315Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:94ebf59bce7a3f903888042774d36480c848f8c2aa34a3a1b878cb38dd3c16d6","observation_id":"5caa45fb-6d24-48eb-8d23-c96a11334fb7","resolution":{"observed_at":"2026-08-07T13:30:37.889234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.605745Z","title":"Alshiekh, R","venue":null,"work_id":"0bc584fc-ca66-41ad-8c18-75575b6fd948","year":2018},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.857266Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:7d11aab925112cdff085d460d33bef84177a41bebf194727311dc7a975a022cf","observation_id":"1ea45edf-8f6a-4412-922d-31cdef7e8a52","resolution":{"observed_at":"2026-08-07T13:30:37.708658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.407253Z","title":null,"venue":null,"work_id":"89f48d72-0c6d-4435-9e91-933abbc42d48","year":1999},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:19.994834Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:6655b3dcf32086e6e6e1d2dcaa23a36eb55c5e3de1c6c7cf4190873199b02c99","observation_id":"4ef9eeff-cff6-48f8-a334-a5a74e082f37","resolution":{"observed_at":"2026-08-07T13:30:37.456951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-07T13:30:20.092151Z","title":"Amodei, C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.092151Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:78f91265415bdd31066ad36c1c845d8aafe2b1625ba4dd6d90f6f8dfded648b8","observation_id":"7a62189b-0e02-41e8-b30e-bfed14d055d6","resolution":{"observed_at":"2026-08-07T13:30:20.092151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:37.109975Z","title":"Berkenkamp, M","venue":null,"work_id":"c32e4314-f87a-449c-bd1a-8e388d73210d","year":2017},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.255035Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:9ee3174b1eb30de52da02e8cb38272f3da16f2f101f70bb3994c8b095a63a29b","observation_id":"fc6ff8e2-20c2-4c3b-86b9-90bfad22a305","resolution":{"observed_at":"2026-08-07T13:30:37.287804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.892006Z","title":"Bhatnagar and K","venue":null,"work_id":"25cd0b84-b946-4403-95a0-ba3c5aa9ce45","year":2012},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.443200Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:9194830d7b334c9032d289db90fe4307f08b8bd2d69ff2fbcdfbf19d0f292c3a","observation_id":"74ccda11-804f-4a36-9ef6-bd3f6e011539","resolution":{"observed_at":"2026-08-07T13:30:36.998638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.708309Z","title":"Black, M","venue":null,"work_id":"558046ff-3009-455f-881d-438f625fee66","year":2024},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.564755Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1b24df6262a5ab0c0e5c9c4d4f5ba30a067f10f941292043c845f185cac26dae","observation_id":"5a2a7343-b76f-4fad-ba6e-a7991a8f7ccb","resolution":{"observed_at":"2026-08-07T13:30:36.763546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.544292Z","title":null,"venue":null,"work_id":"9ffe181c-fd90-46f6-a3ac-36d528a36cd1","year":2005},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.657269Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:7c694b69c5aab0f854f89a97315c2d8c9b4334db4d93bfe8a75661009680c5a4","observation_id":"32c8fa42-bdd5-451d-86ac-026819081ba9","resolution":{"observed_at":"2026-08-07T13:30:36.610803Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.352091Z","title":"Brandfonbrener, A","venue":null,"work_id":"7abaeee2-893a-419c-a1e1-68220031d581","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.882152Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:cd464d378bb6e4567ac57900382587efa3b26cb881f7e287628fb499f71f7396","observation_id":"8d0dea74-9e4d-4cc5-a7a2-0adfaa9148bc","resolution":{"observed_at":"2026-08-07T13:30:36.444884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:36.105527Z","title":null,"venue":null,"work_id":"2385b9bb-73c5-41ff-a835-66eeed5301bc","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:20.964019Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:93ed7e0434a96630a34fb4945f949833024c317e830e111f35683fee816570ac","observation_id":"4f6df005-2369-4bd7-a90c-d7466538cc85","resolution":{"observed_at":"2026-08-07T13:30:36.211969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.916849Z","title":"Cheng, G","venue":null,"work_id":"fcb66fca-a5c4-4b8f-9b60-a941a553fc3a","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.094841Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:678b3efb3d9deac5071f257b475c5307c8d76e833ec6989de48e12119798f90c","observation_id":"c9dddd1d-31a7-4780-9147-a4281bd3b44e","resolution":{"observed_at":"2026-08-07T13:30:36.005293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.764193Z","title":null,"venue":null,"work_id":"f5915234-1294-493a-89e4-3dffc0f7e0bc","year":2017},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.171133Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:c3abea86370510679256335c8e26c0db546d6a9ec70dd0cb8e1683196d803add","observation_id":"6e2775c4-5441-4b23-a1c7-88659cd599c9","resolution":{"observed_at":"2026-08-07T13:30:35.833182Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:21.294753Z","title":"Da Costa, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.294753Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:cca781ff6b0a8c8e1fa63d81eb0e464a7894ea41d5e805db29fce88c35a4f97e","observation_id":"674dfce5-6ac5-4f54-bc8a-68d633f7205e","resolution":{"observed_at":"2026-08-07T13:30:21.294753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.636480Z","title":"Emmons, B","venue":null,"work_id":"0f5e65ea-ae51-4e2d-9e2e-a0e83f7ef7e3","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.394376Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:09c26a6232642b175842e0767fa23eb903b1df154e36bb3d0757e0c90c6ea728","observation_id":"b13a745c-023b-40b8-8a72-08602e0cbedc","resolution":{"observed_at":"2026-08-07T13:30:35.700611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.382575Z","title":null,"venue":null,"work_id":"6938ee25-a943-4af2-a661-12c21cf993d3","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.491943Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:3e307e4101a9663b2512bc08e00120f94695988b269b79b0ed710dfeb3cce62c","observation_id":"1e5e9932-f7f1-489a-bb75-3eba8f490110","resolution":{"observed_at":"2026-08-07T13:30:35.525264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:35.183736Z","title":"Fujimoto, D","venue":null,"work_id":"03f33a29-8c9d-4759-8dc4-a9950c237262","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.614956Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:b493008d2811b1968dc987d0750a01c898a01703fc1a3b91135f535cba996d49","observation_id":"092bc828-ae16-4493-8bed-b153b1723c04","resolution":{"observed_at":"2026-08-07T13:30:35.288966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.998395Z","title":"Fulton and A","venue":null,"work_id":"5f00587b-f7d8-4b9b-a39e-e669a7eca772","year":2018},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.692574Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:8a4a51cff80b0f90bcbc0f4e52003d50898c25570450391bd12e93062c0fbbed","observation_id":"f5e404af-41b3-4494-966c-3c5cc3b0f525","resolution":{"observed_at":"2026-08-07T13:30:35.105286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.814979Z","title":"Garcıa and F","venue":null,"work_id":"f78b7ba4-2dd6-4d9c-81a3-f93cb46ca045","year":2015},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.790603Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:cdec11da78a62d00bb3b5004db06c7ba8b1509c86fc17e9ae3bf163de8afb8ed","observation_id":"a7274ed4-4e90-4f4e-83fa-9173b709f53a","resolution":{"observed_at":"2026-08-07T13:30:34.901866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.587074Z","title":"Gronauer","venue":null,"work_id":"d19c125c-5ae2-420c-89dc-e7fb50b2436e","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.937413Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:74496c8519ba617899b2c6bdd2954f4085f344e04563b8a5f0f2a95bd9f30d40","observation_id":"97fcee7b-9fd3-4b4c-8a43-f7e7b001e6aa","resolution":{"observed_at":"2026-08-07T13:30:34.699316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.409088Z","title":null,"venue":null,"work_id":"eaced940-ad3e-41b8-9746-82b03b8850d5","year":2024},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.049343Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:e7c232893b8d2c1c5bf0478c28926fc7bd25f7ba16873c247e9c4068d16da44d","observation_id":"c32c7df1-e8cf-4c9d-b28f-55a1f4bf4c8d","resolution":{"observed_at":"2026-08-07T13:30:34.500351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:30:22.159218Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.159218Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:69ea9a6c21cfd70872d40e488e3d178e25bc7de02d5d1c79eb7b272ce2ee01d2","observation_id":"adbed44e-9a9b-4514-a306-d885ac1df103","resolution":{"observed_at":"2026-08-07T13:30:22.159218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:34.221871Z","title":null,"venue":null,"work_id":"bd8f82bb-8aaa-488c-b083-d903c20aa8ad","year":2025},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.245173Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:8345d29acffb21abbcc4958b588ef1b68bc27fb212a4edbdc95daa385f1af066","observation_id":"690ac445-dd81-405f-8f18-d5424fdf5081","resolution":{"observed_at":"2026-08-07T13:30:34.344303Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.995443Z","title":"Hambly, R","venue":null,"work_id":"c2d48c3b-d7f7-4dcd-aab8-5663706ae517","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.326144Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:7ad37197969250fe520288da79fb345f0c29777d97cd7f95cc2202ddcd1660c1","observation_id":"dc55872e-60ae-495a-90c6-99f555156613","resolution":{"observed_at":"2026-08-07T13:30:34.049121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.815474Z","title":null,"venue":null,"work_id":"b70f0c0a-dd3f-4be5-b283-16c7e5ba8222","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.391642Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:5bc4be4222f79ebb6792011a29e37c91cf0607b84a608f1e1f6697c3be09250f","observation_id":"00fbdec3-2754-4655-acb8-94c756ce42f1","resolution":{"observed_at":"2026-08-07T13:30:33.895147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.659503Z","title":null,"venue":null,"work_id":"900952fb-3577-4f8f-b9c9-b575e220db76","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.504885Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:c0edde49760c5a0864262577d222948a78e2ef0b51378cb0a2fc852d3ac7c6c5","observation_id":"6897be8e-84ed-4d96-868a-a3899270c6c7","resolution":{"observed_at":"2026-08-07T13:30:33.732780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.462951Z","title":null,"venue":null,"work_id":"fe200598-4965-4991-9b00-0266e6d0443c","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.637476Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:b1d78f04fa096b47dda58e179593d579720b7f93daca4ce582db15e04ff91df4","observation_id":"8e5fce55-3c99-4ee3-a2a8-9332af96a67c","resolution":{"observed_at":"2026-08-07T13:30:33.570967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06750","last_updated":"2023-11-18T13:19:55Z","snapshot_observed_at":"2026-08-09T07:50:43.395585Z","submitted_at":"2022-05-13T16:34:36Z","title":"Provably Safe Reinforcement Learning: Conceptual Analysis, Survey, and Benchmarking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06750","snapshot_observed_at":"2026-08-07T13:30:22.701820Z","title":"Krasowski, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.701820Z"},"links":{"cited_paper":"/paper/2205.06750","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:b73f1389c6c3c254f98a79fd1996b669f90dbeb525546717bfdde850f01a707f","observation_id":"cb9f6868-d166-4fd2-9fb6-db9ed9a6026c","resolution":{"observed_at":"2026-08-07T13:30:22.701820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:33.254296Z","title":"Kumar, J","venue":null,"work_id":"384158ae-0880-4566-b8eb-6146e942def6","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.786585Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:201f6b6e1692e9f3bb4fb467d1604790d1e9c375673023e282e6c1388cc1d521","observation_id":"02dac6d4-7dbd-4165-993c-83a9995dff40","resolution":{"observed_at":"2026-08-07T13:30:33.369305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-07T16:37:03.741931Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T13:30:22.843583Z","title":"Kumar, X","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.843583Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1e4301976a76d511b265c234fca6fb85467d10146526799f63c0e23384615a61","observation_id":"0124c1ed-df2a-44cc-8b23-59c16ca05f04","resolution":{"observed_at":"2026-08-07T13:30:22.843583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.973725Z","title":null,"venue":null,"work_id":"3585c4bd-56ba-472a-ae0f-7dbc8a2fdeef","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:22.975095Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:112be1dc5fd8418bede821e82f1ef7cb96458cb53e3a2e88dc7e76707fc73827","observation_id":"139671e5-860b-468f-97ce-5e25eb919d11","resolution":{"observed_at":"2026-08-07T13:30:33.098066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.750787Z","title":null,"venue":null,"work_id":"54757f64-5fe3-433c-8eef-125a7537a15c","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.089264Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:012915f814703b0bf212b46cefec0f15a25253939b7511f6419ad00ecb654829","observation_id":"febdd373-fd80-472d-9a82-065076405ea4","resolution":{"observed_at":"2026-08-07T13:30:32.875494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.550600Z","title":"Levine, C","venue":null,"work_id":"599604ec-a78a-4581-8cf9-966878c461e9","year":2016},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.184252Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:586aae3a9756ee10b3e0bb267e34078cedc35128356c1f3237483439b86859c9","observation_id":"6ea14459-59f1-4823-b1e6-d0a9d8720cdb","resolution":{"observed_at":"2026-08-07T13:30:32.638209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T13:30:23.279554Z","title":"Levine, A","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.279554Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:f27bfec8cfadfb7c784336060e8565b2ce6d11dac1d015e43bb285cb8f45dd11","observation_id":"dd2a1b61-3e23-49c2-97e9-7bb23ee939f8","resolution":{"observed_at":"2026-08-07T13:30:23.279554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.305975Z","title":null,"venue":null,"work_id":"cee9d281-3208-466c-98c8-b6b1fd891552","year":2002},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.333956Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:50a8f5cb63a923e6a46994fd9b97c83dfac48352d1561c06cfa1b46c941c113e","observation_id":"dc0847ab-7a35-4193-904f-bde708311a34","resolution":{"observed_at":"2026-08-07T13:30:32.392354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:32.112823Z","title":null,"venue":null,"work_id":"b7c711bf-2e9c-4c81-bcd9-5d91002ff2cf","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.434878Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:8b5b675777c5a96815497318195fe0e6644e3785b008e8e3948177332b3926bc","observation_id":"93140e8d-fce0-41ad-a807-5a00ac9cbac0","resolution":{"observed_at":"2026-08-07T13:30:32.244747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09303","last_updated":"2023-06-16T17:54:06Z","snapshot_observed_at":"2026-08-09T03:59:11.445592Z","submitted_at":"2023-06-15T17:31:26Z","title":"Datasets and Benchmarks for Offline Safe Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09303","snapshot_observed_at":"2026-08-07T13:30:23.525259Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.525259Z"},"links":{"cited_paper":"/paper/2306.09303","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:e96493e6bff3a803be8c60e88181975cd28813f48242b10e29430cfaa4b64bd3","observation_id":"f0751b9c-ed33-46ac-bf04-49112ec2ab7d","resolution":{"observed_at":"2026-08-07T13:30:23.525259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.904759Z","title":null,"venue":null,"work_id":"11ecb9c9-be68-4fab-9d8f-2553bcb2de5b","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.654841Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:e39caea59382a74924a4276f5586ba6d9a85001a14b9d4c3f3d721d26c2b645f","observation_id":"da4a3e35-5a01-478f-b769-9c6494246e5e","resolution":{"observed_at":"2026-08-07T13:30:32.017371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.664485Z","title":"Ouyang, J","venue":null,"work_id":"55425bfe-4cc3-41a6-8c47-dc9316df452b","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.724974Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:7677f78115dce93338c2da119138b4b58461a6fc47cbc785e8e7a670a0528e3e","observation_id":"dc6ab268-0dca-444c-80f9-9dea7274a561","resolution":{"observed_at":"2026-08-07T13:30:31.804742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.09101","last_updated":"2022-01-12T20:00:13Z","snapshot_observed_at":"2026-07-06T08:38:33.799230Z","submitted_at":"2019-11-20T17:56:39Z","title":"Safe Policies for Reinforcement Learning via Primal-Dual Methods","version":2},"cited_work":{"arxiv_id":"1911.09101","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.09101","snapshot_observed_at":"2026-08-07T13:30:26.934736Z","title":"Safe Policies for Reinforcement Learning via Primal-Dual Methods","venue":"eess.SY","work_id":"96a5ece9-da3e-48f7-97f1-00f15f99da82","year":2019},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.813683Z"},"links":{"cited_paper":"/paper/1911.09101","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:8396a475ffa6cd8a275281cdcba4fa28086ecd1aa2155b6ccffc1312b1f1ae10","observation_id":"10e93eee-0ed5-4ce2-8e51-32cbdd160ab2","resolution":{"observed_at":"2026-08-07T13:30:27.002527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:23.872152Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.872152Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:bab7a9bf0a774795612181153c408e672bf140785470365602533f6745f7d3ad","observation_id":"4d25c2c2-a451-4962-96da-cd2e252c5317","resolution":{"observed_at":"2026-08-07T13:30:23.872152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.447337Z","title":null,"venue":null,"work_id":"efd0261b-fafa-4a78-95f6-5faedae08c39","year":2018},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:23.963485Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:064c272beec398d66c0c6356d875dc8d4d4947681a738254b9c10afb08b21d43","observation_id":"3871230a-2563-4852-b4bb-ec764f5f4fae","resolution":{"observed_at":"2026-08-07T13:30:31.514817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.236411Z","title":"Satija, P","venue":null,"work_id":"3ed52609-e631-4101-9c62-e683f59f4d35","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.009443Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:028b211a29fda05f8d1d45e2bb6341878c4ab297ccb47cebfb44cd08abb99033","observation_id":"4ff7817e-ca91-4258-844d-b00f8440da8f","resolution":{"observed_at":"2026-08-07T13:30:31.347590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-06T05:45:23.347318Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-07T13:30:24.086262Z","title":"Schmidhuber","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.086262Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:85c2d3cae91884548a7e2f07fc0c45b010a4bc472755ed9bbc332228ef15b0af","observation_id":"90cddf7c-eeb2-4a7d-bc5b-4a7371aa3876","resolution":{"observed_at":"2026-08-07T13:30:24.086262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:31.072727Z","title":"Sootla, A","venue":null,"work_id":"0ac77677-6dce-41a3-8af6-f855ed49c055","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.163137Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1f170b986992eb957c9d51803991693890422908aebbdfc33842936f55aa769d","observation_id":"add3ead9-d96b-4ea1-8ec3-d1b2e0eb72dc","resolution":{"observed_at":"2026-08-07T13:30:31.171392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.911306Z","title":"Srinivas, A","venue":null,"work_id":"98f0219e-7207-442a-9ded-f41bb0506f66","year":2010},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.214658Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:cced79b08f55966038c58c228d0a702b82aa4e3e4a4084a694fb371b97c187b0","observation_id":"d66c4c7e-dc5a-4ada-9017-3768a69efe62","resolution":{"observed_at":"2026-08-07T13:30:30.974743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-07T13:30:24.270417Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.270417Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:475b007d8fdaaf0fc79d33df4af2fd6958c6afc2915b30bf5e2aa3b1c3e04ffa","observation_id":"fc5c38cc-235b-47fc-a44a-eabe153027c2","resolution":{"observed_at":"2026-08-07T13:30:24.270417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.688246Z","title":"Stooke, J","venue":null,"work_id":"20388c8f-9a8c-452d-9ae2-527a693d9c22","year":2020},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.345683Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:cbe6eebb62763dc48df488592f3c1a2e7a02b2dd9b927e590929446d3c1f6a7e","observation_id":"926187b4-167e-4697-8738-b0f9704de70d","resolution":{"observed_at":"2026-08-07T13:30:30.791525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.511705Z","title":null,"venue":null,"work_id":"f9cb4f9f-72ec-4980-8c6f-e35f6f8f3d31","year":2015},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.514869Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:1a59a854169c53df75c5f7a3b827ca1559cb09f763020d7e43b072424ae740bf","observation_id":"d7812556-4fad-48c9-89e9-0720b8ceea70","resolution":{"observed_at":"2026-08-07T13:30:30.584763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.348990Z","title":null,"venue":null,"work_id":"089245a0-a60c-4290-9dfc-10c4bae5ee53","year":2018},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.636311Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:d644d40baf724311da179b5fb7a067939672fb2002c982f1e82f555fd42479ad","observation_id":"3469f3d0-0a5b-49e6-8e86-57cabe6f424d","resolution":{"observed_at":"2026-08-07T13:30:30.442925Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:30.213757Z","title":"Turchetta, F","venue":null,"work_id":"2a018791-3fc1-4a59-810b-046f90c5ac90","year":2016},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.735023Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:26f2ac63931d5333d9f7427c3d745df3446c47ce84a6940791518596bf5c64f0","observation_id":"47120573-a122-4411-92b6-ec129f9b34d5","resolution":{"observed_at":"2026-08-07T13:30:30.277183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:24.804655Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.804655Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:d111c8539887f5b76d13425443f903c99f2ccd8856dd2fc69cec8e26fe885e24","observation_id":"b1411c21-861b-4134-81b4-67a501ca461e","resolution":{"observed_at":"2026-08-07T13:30:24.804655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.977851Z","title":"Wachi and Y","venue":null,"work_id":"e45ce169-2ddb-4326-abe8-8de80a9ed9f3","year":2020},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:24.914873Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:85057056aa5e9598910dec058502e90e136f10efc70010cd209258260bdaa3ef","observation_id":"d32a2ba4-93e9-441a-a0b4-beb49d816e7d","resolution":{"observed_at":"2026-08-07T13:30:30.104278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.800347Z","title":"Wachi, W","venue":null,"work_id":"9b281455-f043-4503-84e1-c8e0a86f9f1d","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.018298Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:fec7144491619b29c54f32fb696618c5324742b434d259a070e24c601b0d6c6c","observation_id":"a0062dd8-7c4c-476a-aea2-d501f869a7db","resolution":{"observed_at":"2026-08-07T13:30:29.874805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.634490Z","title":"Wachi, X","venue":null,"work_id":"9af3918f-80e8-424e-878e-d283268a0baa","year":2024},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.234827Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:29660e19b139be22acc914d708c6bd710de5096f2c36263ffe530b248f218ca0","observation_id":"327c2ee6-cc89-40f5-8722-4dfe318abc7f","resolution":{"observed_at":"2026-08-07T13:30:29.713700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.414879Z","title":null,"venue":null,"work_id":"8e26eed3-421c-4f34-8cf6-50e4fd66e28c","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.375135Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:e2460de910cb0ac191c3afee9ae4ad3995984973727851aec4a8a5c7d3036ff4","observation_id":"3cfc6953-bd2c-471a-80eb-5e8de9f2eb1b","resolution":{"observed_at":"2026-08-07T13:30:29.524828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:29.204808Z","title":null,"venue":null,"work_id":"4922e78c-2d51-408e-bec5-f3e423a353d5","year":2022},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.644735Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:b689a61ca8f7ddc9e376482b5b25f5943061af8f2fa51ff48ac345a2c0a35751","observation_id":"4400f6c7-0285-4bb1-9c33-50dd9d5be1a7","resolution":{"observed_at":"2026-08-07T13:30:29.299540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.953341Z","title":"Yang and M","venue":null,"work_id":"a947639b-66bf-4b18-96d6-6b426408be82","year":2020},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.815177Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:bef4d87dd9c2f71d7b207e78f354c7731663f1f8cbc515da784ef37c475209b8","observation_id":"23b55a16-b18d-49ce-a66f-b55830d03c47","resolution":{"observed_at":"2026-08-07T13:30:29.074292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.835688Z","title":null,"venue":null,"work_id":"b28b231f-06a8-4426-9e2a-77b44f37268d","year":2023},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:25.934915Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:63107786ae7d24f64da6529e4fd39307d8bc5c5f4dddcc48500ea1e8895479cc","observation_id":"701d1300-f321-4120-aba9-54be7671f6b7","resolution":{"observed_at":"2026-08-07T13:30:28.892426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.698205Z","title":null,"venue":null,"work_id":"7f9ce713-28a3-432b-8a6a-8e4095807d92","year":2021},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.009155Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:fa30b41e460d9f2010f44d1f50a82b749bb18b56a5e50e686ae4d93e504b323e","observation_id":"92c4b7fb-3b1e-4c95-9a80-e8f6a8c5dfe6","resolution":{"observed_at":"2026-08-07T13:30:28.742128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.547593Z","title":null,"venue":null,"work_id":"127823b0-af48-4f2b-ac10-a7682f14778d","year":null},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.125071Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:d8f73358597f453608d0477b9db02e3ae92d65e1347101d6e31aab3809a15f73","observation_id":"d7a6d77d-4f82-41b8-9618-8e2501cd0dcc","resolution":{"observed_at":"2026-08-07T13:30:28.579001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:30:28.141570Z","title":"Let β : X → ∆(A) be a behavior policy and D := {Ξ(i)}n i=1 ∼ (Pβ)n be a collection of n i.i.d","venue":null,"work_id":"5fd004aa-0e48-460f-8372-fc6a4bc9550f","year":2000},"citing_paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:26.255011Z"},"links":{"citing_paper":"/paper/2505.21852"},"observation_digest":"sha256:11d652705c40d535e717e6e98642dfbaaf5f1934e7c7e93117d3badcbce46a62","observation_id":"6362a78c-7d61-49b9-95da-5e8cb5b3a191","resolution":{"observed_at":"2026-08-07T13:30:28.467897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21852","last_updated":"2025-05-28T00:48:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:00:27.188007Z","submitted_at":"2025-05-28T00:48:20Z","title":"A Provable Approach for End-to-End Safe Reinforcement Learning"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.21852."}