{"as_of":"2026-08-10T12:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b9bf4a954e4cc85fd2a88b09ce46a5c451c3ae125b15288bc6fa96c13233948","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:07:09.566879Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:37:41.630698Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T11:35:19.078046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00700","snapshot_observed_at":"2026-08-05T12:37:41.630698Z","title":"Central path proximal policy optimiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01432","last_updated":"2025-09-01T12:42:43Z","snapshot_observed_at":"2026-08-08T16:17:47.618559Z","submitted_at":"2025-09-01T12:42:43Z","title":"The Geometry of Nonlinear Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:37:41.630698Z"},"links":{"cited_paper":"/paper/2506.00700","citing_paper":"/paper/2509.01432"},"observation_digest":"sha256:6ed7aee768461b465917c2aa023331f277636f827a19f7a951fdac53a55211d6","observation_id":"7a1ef6a6-4859-4cd6-84de-2a19d6439ba4","resolution":{"observed_at":"2026-08-05T12:37:41.630698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"cited_work":{"arxiv_id":"2506.00700","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00700","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Central path proximal policy optimization","venue":null,"work_id":"94555858-e38c-45e6-8f9b-1771dd4ec335","year":2025},"citing_paper":{"arxiv_id":"2604.18578","last_updated":"2026-04-30T14:35:55Z","snapshot_observed_at":"2026-08-02T22:04:13.250695Z","submitted_at":"2026-04-20T17:59:01Z","title":"Bounded Ratio Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T04:50:11.020901Z"},"links":{"cited_paper":"/paper/2506.00700","citing_paper":"/paper/2604.18578"},"observation_digest":"sha256:3c261885bae9f3fbed756d01317a63fc5a80e99f222f985324f24c5dc86ed814","observation_id":"d095a95e-6a3c-48b7-817c-c5acf95f3998","resolution":{"observed_at":"2026-05-10T11:35:19.079386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00700/citation-record","integrity":"/paper/2506.00700/integrity","json":"/paper/2506.00700/citation-record.json","paper":"/paper/2506.00700"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:10.418334Z","title":"A safe exploration approach to constrained Markov decision processes","venue":null,"work_id":"e4a514a6-ee85-4acc-b727-103f24ee5b29","year":2024},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.931227Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:9430de5756fef24b30591f06e655a4d8767d10762e5e239cd51324b8eafd607d","observation_id":"074502be-9dda-46de-81e9-5d3b8d32d5fd","resolution":{"observed_at":"2026-08-07T12:07:10.495244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.12228","last_updated":"2022-06-18T22:00:03Z","snapshot_observed_at":"2026-08-10T06:04:57.020387Z","submitted_at":"2021-12-22T21:12:28Z","title":"Direct Behavior Specification via Constrained Reinforcement Learning","version":6},"cited_work":{"arxiv_id":"2112.12228","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.12228","snapshot_observed_at":"2026-08-07T12:07:10.111817Z","title":"Direct Behavior Specification via Constrained Reinforcement Learning","venue":"cs.LG","work_id":"f1b70300-77ba-42a7-a3a2-606205f0b9a3","year":2021},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.093230Z"},"links":{"cited_paper":"/paper/2112.12228","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:f8f82599a3230d3a8f9363ab9526327e6a57921a8515156f799dd88a9708bc73","observation_id":"78af1034-67c6-4a9f-8fd3-24376f09bebb","resolution":{"observed_at":"2026-08-07T12:07:10.187120Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.03964","last_updated":"2020-07-08T08:43:14Z","snapshot_observed_at":"2026-08-10T04:15:48.933302Z","submitted_at":"2020-07-08T08:43:14Z","title":"Responsive Safety in Reinforcement Learning by PID Lagrangian Methods","version":1},"cited_work":{"arxiv_id":"2007.03964","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.03964","snapshot_observed_at":"2026-08-07T12:07:09.808968Z","title":"Responsive Safety in Reinforcement Learning by PID Lagrangian Methods","venue":"math.OC","work_id":"335b691a-515b-4a03-be1d-bf7b31503217","year":2020},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.280854Z"},"links":{"cited_paper":"/paper/2007.03964","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:177fdd620036e57e2b9bc829c049c1dc0e8cc14ff68a5811eeeaf04633d80bd2","observation_id":"4faecdac-4fa9-411c-a493-11ed459e1bb1","resolution":{"observed_at":"2026-08-07T12:07:09.904564Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14508","last_updated":"2024-03-21T16:02:52Z","snapshot_observed_at":"2026-08-10T07:38:48.380151Z","submitted_at":"2024-03-21T16:02:52Z","title":"Constrained Reinforcement Learning with Smoothed Log Barrier Function","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14508","snapshot_observed_at":"2026-08-07T12:07:09.385071Z","title":"Constrained Re- inforcement Learning with Smoothed Log Barrier Function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.385071Z"},"links":{"cited_paper":"/paper/2403.14508","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:44fd0aa1284280ef811110516b91202847f0993bc8b0ffb09ff156baf8293565","observation_id":"d55bf51f-2cc4-4f0f-8774-b0fda9159b60","resolution":{"observed_at":"2026-08-07T12:07:09.385071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/517","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Yiming Zhang, Quan Vuong, and Keith Ross","venue":"Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence","work_id":"cd753ca5-77b9-4973-ada1-4acc535df759","year":2022},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.480957Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:631f2486d32d4f4ddb6044740dbb87406f62be029ee6952fec2b1de2b85242bd","observation_id":"d3628220-eedf-49dc-a3a3-71f7824ecd61","resolution":{"observed_at":"2026-08-07T12:07:09.751998Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:10.267864Z","title":"surrogate advantage trick","venue":null,"work_id":"e515b109-d18c-4218-bde8-e343a61f95d8","year":2023},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.566879Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:eba55fe47049bb1b95087c343a18eee784aceb9a2f8254e1845d032fc9d1f108","observation_id":"5d638274-83d0-44c6-8aef-e4d9f5cc284b","resolution":{"observed_at":"2026-08-07T12:07:10.352342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-07T12:07:09.141595Z","title":"John Schulman, Sergey Levine, Philipp Moritz, Michael I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.141595Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:f3cc8b802e6cd4b10c0644c26c03433315a0d3f9a46f22e7b83ab853034e606a","observation_id":"da807287-27f3-458c-99d7-ddad26648efb","resolution":{"observed_at":"2026-08-07T12:07:09.141595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:10.585342Z","title":"Dimitri P Bertsekas","venue":null,"work_id":"78e14604-225a-429c-9b9c-9fcad3a38cb2","year":2017},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.578032Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:fe21979fb1e38a53a71d4bd9890412a6faf1dd06e293af85ea12a18c36e46448","observation_id":"d1d34400-fb63-46a9-b893-1e669deacd40","resolution":{"observed_at":"2026-08-07T12:07:10.664488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10031","last_updated":"2019-02-11T20:52:42Z","snapshot_observed_at":"2026-08-04T06:42:19.463125Z","submitted_at":"2019-01-28T23:14:58Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10031","snapshot_observed_at":"2026-08-07T12:07:08.633497Z","title":"Robert M Corless, Gaston H Gonnet, David EG Hare, David J Jeffrey, and Donald E Knuth","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.633497Z"},"links":{"cited_paper":"/paper/1901.10031","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:e01442b1f4eae5e28c3ff7451a9a62bf93e51a7b6ba7f6d497d08d925b948864","observation_id":"3f78ce86-e4d7-4720-8ad6-c368ea7bfc38","resolution":{"observed_at":"2026-08-07T12:07:08.633497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:07:08.702350Z","title":"Jincheng Mei, Chenjun Xiao, Bo Dai, Lihong Li, Csaba Szepesvári, and Dale Schuurmans","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.702350Z"},"links":{"citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:d873900257f2fbc8b2474ae2ab14642a2ec1537c2f02bd62138f16b264e75936","observation_id":"2f5a27ad-336f-436e-9782-1670098eb2d9","resolution":{"observed_at":"2026-08-07T12:07:08.702350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-07T12:07:08.990567Z","title":"Benchmarking safe exploration in deep reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.990567Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:cd194a240820edc561f6aa65cfa40218522f517247d1d581448577ae5be85721","observation_id":"6ba153c4-cc06-4dc8-bf5c-d9d8f999b133","resolution":{"observed_at":"2026-08-07T12:07:08.990567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-07T12:07:08.844809Z","title":"A unified view of entropy-regularized Markov decision processes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.844809Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:b70db384fc511a9ae0de6ae64c1c152e949c028d7fd15f038f1be8083c627919","observation_id":"4b21ca17-83c7-407c-bef8-f3c3fc4823e1","resolution":{"observed_at":"2026-08-07T12:07:08.844809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04558","last_updated":"2024-06-07T00:13:31Z","snapshot_observed_at":"2026-08-04T09:33:11.707216Z","submitted_at":"2024-06-07T00:13:31Z","title":"On PI Controllers for Updating Lagrange Multipliers in Constrained Optimization","version":1},"cited_work":{"arxiv_id":"2406.04558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04558","snapshot_observed_at":"2026-08-07T12:07:09.965625Z","title":"On PI Controllers for Updating Lagrange Multipliers in Constrained Optimization","venue":"cs.LG","work_id":"375a3c23-c124-4691-ab75-d50ad502bd50","year":2024},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:09.219280Z"},"links":{"cited_paper":"/paper/2406.04558","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:ecfedbba989f0203da501f792c84b09ca0ff5cbb2c2a767c92fdd6398f7fb560","observation_id":"9eb6c714-6dfd-4a21-b04b-ee6f1af7c67d","resolution":{"observed_at":"2026-08-07T12:07:10.017454Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02957","last_updated":"2025-08-15T12:29:02Z","snapshot_observed_at":"2026-08-08T11:31:58.146859Z","submitted_at":"2024-11-05T09:55:50Z","title":"Embedding Safety into RL: A New Take on Trust Region Methods","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02957","snapshot_observed_at":"2026-08-07T12:07:08.760132Z","title":"Johannes Müller and Semih Cayci","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:07:08.760132Z"},"links":{"cited_paper":"/paper/2411.02957","citing_paper":"/paper/2506.00700"},"observation_digest":"sha256:8b848f902134e67660c275441220cedcba3f305d439ed2dc2508010fa8e8cc9b","observation_id":"fc27e03e-c0c5-4d02-a012-6a3d05bf8902","resolution":{"observed_at":"2026-08-07T12:07:08.760132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00700","last_updated":"2025-08-15T12:20:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T10:13:18.828209Z","submitted_at":"2025-05-31T20:14:29Z","title":"Central Path Proximal Policy Optimization"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 2 inbound Pith citation observations for arXiv:2506.00700."}