{"as_of":"2026-08-10T12:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acb2bfb6112b307295cbe34b353125282937638369724f2472bc224a1baf2570","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:34:23.413516Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22640/citation-record","integrity":"/paper/2507.22640/integrity","json":"/paper/2507.22640/citation-record.json","paper":"/paper/2507.22640"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:28.875704Z","title":"Reinforcement Learning: An Introduction,","venue":null,"work_id":"bab6243a-7733-4b7e-97e5-d311e72994c7","year":2018},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:16.903656Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:2648ca7d4909194e387a779273bede42bd9bde7de63b7af6a199aedc63e729a0","observation_id":"47d0afb2-e201-4c9c-91b8-555d6cd64d96","resolution":{"observed_at":"2026-08-06T11:34:28.983136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:28.655711Z","title":"From automated to autonomous process operations,","venue":null,"work_id":"ab92ecca-51ef-4514-afc2-ae44272360f9","year":2025},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.019529Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:4d049117b27d1bd3af7403e33f278c671482491442f69bf8af2d19557b75aae9","observation_id":"774554ce-b087-4f03-8bc8-5edd85b24f8c","resolution":{"observed_at":"2026-08-06T11:34:28.773197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T11:34:17.173306Z","title":"Concrete Problems in AI Safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.173306Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:b80111a56bdc2d71da66bdf27a9a3c46eb082ba819385ecc2333c0651017b44d","observation_id":"1c1f6956-1bd8-4db8-b9ec-41dfddbcc373","resolution":{"observed_at":"2026-08-06T11:34:17.173306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:28.450267Z","title":"Optimal grade transition for polyethylene reactors via NCO tracking,","venue":null,"work_id":"d58021b4-f025-4247-ada0-1241e1d2d179","year":2005},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.315159Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:db4231893985a8ffa49a066b395a47d4ceb9dd43c63ba35c5cb61bfb28c030db","observation_id":"508c8ec1-2f66-422f-a823-a991a2c02b1b","resolution":{"observed_at":"2026-08-06T11:34:28.524681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:28.263964Z","title":"Iterative learning control-based batch process control technique for integrated control of end product properties and transient profiles of process variables,","venue":null,"work_id":"5823f9ad-7c44-42bd-b125-a582d4153c58","year":2003},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.502796Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:69e3fc63146085b0d5a19ac45c182f549f36fba84435c89b29742f2ba3b0c60a","observation_id":"c5c74b45-b2e3-4584-8979-918730fc3169","resolution":{"observed_at":"2026-08-06T11:34:28.351490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.993824Z","title":"Integrated scheduling and dynamic optimization of grade transitions for a continuous polymerization reactor,","venue":null,"work_id":"00a15afb-7755-4c80-836f-9a830dc777a5","year":2008},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.711036Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:726d686e832e91bf3b0a7462c07f83d756c99afd1e4ba9e6b8f834b9145253df","observation_id":"ec392a86-50b6-4a89-922f-37f1aa9bb745","resolution":{"observed_at":"2026-08-06T11:34:28.139301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.840626Z","title":"The general problem of the stability of motion,","venue":null,"work_id":"9b6706d8-0d1f-41cc-ac11-31691ad1d159","year":1992},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:17.887751Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:0e45a42281d515a42dc7f4469de5a6b9892b26e41c854b3b3e255bd6d6f75c50","observation_id":"99ea38c8-7d60-44dc-b15a-e78182ec8bf7","resolution":{"observed_at":"2026-08-06T11:34:27.895469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.644498Z","title":null,"venue":null,"work_id":"459c24bb-2076-4e60-aeb1-674acb673930","year":1996},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.102389Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:3f09e1c7ff904cebde7fd73dd1aaa8c85b11c31d865a97601655592971131e82","observation_id":"37dbd767-c63b-4c32-a7f4-cfbedc629599","resolution":{"observed_at":"2026-08-06T11:34:27.725152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07152","last_updated":"2017-06-14T17:59:12Z","snapshot_observed_at":"2026-08-02T02:55:29.365709Z","submitted_at":"2016-09-22T20:10:57Z","title":"Input Convex Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07152","snapshot_observed_at":"2026-08-06T11:34:18.321318Z","title":"Input Convex Neural Networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.321318Z"},"links":{"cited_paper":"/paper/1609.07152","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:6b494eaac00854925a27d1ecbb362bb8a65872054fdc9560a499ec3bd42406d0","observation_id":"eb5cd566-8ea5-4177-b7a8-d22666238a99","resolution":{"observed_at":"2026-08-06T11:34:18.321318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.08551","last_updated":"2017-11-13T18:49:54Z","snapshot_observed_at":"2026-07-06T05:44:01.217829Z","submitted_at":"2017-05-23T22:20:08Z","title":"Safe Model-based Reinforcement Learning with Stability Guarantees","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.08551","snapshot_observed_at":"2026-08-06T11:34:18.448416Z","title":"Safe Model-based Reinforcement Learning with Stability Guarantees,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.448416Z"},"links":{"cited_paper":"/paper/1705.08551","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:4ae9b5a69ae295a150c31fc65c4e03348f7ae0088cac1f173169d19094b31d05","observation_id":"aeeaa0b7-fca2-4bff-938c-093e73a7bd10","resolution":{"observed_at":"2026-08-06T11:34:18.448416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.401597Z","title":"Control Barrier Function Based Quadratic Pro- grams for Safety Critical Systems,","venue":null,"work_id":"ef8699cb-34fc-41ce-bd02-9c74c4e840bd","year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.607406Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:18f4e7c31f242af6d221ee1a7c27f638094c758170688d1407407d803ac96c3b","observation_id":"dc70046b-ce11-4f08-afec-de8e3b61fd2f","resolution":{"observed_at":"2026-08-06T11:34:27.486926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:27.150058Z","title":"Safe and Stable RL (S2RL) Driving Policies Using Control Barrier and Control Lyapunov Functions,","venue":null,"work_id":"599edd98-a29a-4478-928b-89da77891a44","year":2023},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.749875Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:e5411cab9831349799cff2a6fc13e567c616241f91556a686903ac8d3a86cb5a","observation_id":"a584b792-8643-44bb-8e73-9c5b521064e9","resolution":{"observed_at":"2026-08-06T11:34:27.279331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10528","last_updated":"2017-05-30T10:07:31Z","snapshot_observed_at":"2026-08-07T17:23:05.276464Z","submitted_at":"2017-05-30T10:07:31Z","title":"Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10528","snapshot_observed_at":"2026-08-06T11:34:18.893392Z","title":"Constrained Policy Optimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:18.893392Z"},"links":{"cited_paper":"/paper/1705.10528","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:baa62895bee74e5d19c7c15d1ca948b3f1b16541d58bc23d5cbf721a4b673f32","observation_id":"6fbb22bf-b6ad-4ad6-a4a7-bd1ad960f3de","resolution":{"observed_at":"2026-08-06T11:34:18.893392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.08757","last_updated":"2018-01-26T11:11:18Z","snapshot_observed_at":"2026-08-09T14:33:35.632300Z","submitted_at":"2018-01-26T11:11:18Z","title":"Safe Exploration in Continuous Action Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.08757","snapshot_observed_at":"2026-08-06T11:34:19.104125Z","title":"Safe Exploration in Continuous Action Spaces,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.104125Z"},"links":{"cited_paper":"/paper/1801.08757","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:d39794dfbac46e9c399d915c6e6d47230cbf8f7a0e6e68dbeac54d22288dcb84","observation_id":"3d6583d2-0b5b-4715-98a1-3576e07c9e16","resolution":{"observed_at":"2026-08-06T11:34:19.104125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-06T11:34:19.197355Z","title":"Conservative Q-Learning for Offline Reinforcement Learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.197355Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:7ba59f2437d9b3b1cc2c2f194fb9e10e0c6a57a7de9edabf16d59df7fad732da","observation_id":"10db63f3-0676-4291-8c36-01bea85205dc","resolution":{"observed_at":"2026-08-06T11:34:19.197355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T11:34:19.396964Z","title":"Offline Reinforcement Learning with Implicit Q-Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.396964Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:4dba6578b6addbe8d1acc602a73d91b205ca3f9139a32e70a23161fe8fd6439f","observation_id":"c007703d-cd76-4faa-97ee-60b7af00f21f","resolution":{"observed_at":"2026-08-06T11:34:19.396964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13239","last_updated":"2020-11-22T07:04:17Z","snapshot_observed_at":"2026-08-06T03:32:02.156770Z","submitted_at":"2020-05-27T08:46:41Z","title":"MOPO: Model-based Offline Policy Optimization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13239","snapshot_observed_at":"2026-08-06T11:34:19.560544Z","title":"MOPO: Model-based Offline Policy Optimization,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.560544Z"},"links":{"cited_paper":"/paper/2005.13239","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:dfc45353057c01eb1ddb1818b53a6019663fcf9cfb49bd5a1de7da50dcb9f0da","observation_id":"cf93d61e-21ef-4c72-b842-e954f85b855f","resolution":{"observed_at":"2026-08-06T11:34:19.560544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.34162","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:24.150136Z","title":"Actor–Critic Physics-Informed Neural Lyapunov Con- trol,","venue":null,"work_id":"04b8ad31-39fc-4e2d-b1eb-7a076df646b8","year":2024},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.741550Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:9b1cc12985533bbedf2ab8960942768a9e0fed18104273fe93520b9133b7c1ea","observation_id":"4ccfd0f9-726d-4af3-afb6-4699c5e56739","resolution":{"observed_at":"2026-08-06T11:34:24.277113Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10044","last_updated":"2017-10-27T09:35:26Z","snapshot_observed_at":"2026-08-04T16:01:11.564656Z","submitted_at":"2017-10-27T09:35:26Z","title":"Distributional Reinforcement Learning with Quantile Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10044","snapshot_observed_at":"2026-08-06T11:34:19.925848Z","title":"Distributional Reinforcement Learning with Quantile Regression,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:19.925848Z"},"links":{"cited_paper":"/paper/1710.10044","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:ed78975c657d7e7e25439f9b4020539862fddfceb229b09ba381368799ada8a6","observation_id":"96778281-0ef6-4a6c-8dc0-c64a2fd2973b","resolution":{"observed_at":"2026-08-06T11:34:19.925848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:26.824733Z","title":"EKG-AC: A New Paradigm for Process Indus- trial Optimization Based on Offline Reinforcement Learning With Expert Knowledge Guidance,","venue":null,"work_id":"97b4f8e3-0378-48d3-bf92-17c3e9299733","year":2025},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.077489Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:17cafe1c400813d77b1ce0cab60531a8164b5c9346748422bf0075cd9278491b","observation_id":"370834ac-9400-41f1-a108-4603f8744f26","resolution":{"observed_at":"2026-08-06T11:34:27.022358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11835","last_updated":"2019-02-26T19:58:06Z","snapshot_observed_at":"2026-08-08T07:19:36.510849Z","submitted_at":"2018-05-30T07:23:47Z","title":"Optimal Control Via Neural Networks: A Convex Approach","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11835","snapshot_observed_at":"2026-08-06T11:34:20.306372Z","title":"Optimal Control Via Neural Networks: A Convex Approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.306372Z"},"links":{"cited_paper":"/paper/1805.11835","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:db5dabf40c6a9198cd4575bceeead478de91f94f83a9f8428a032675cc20553d","observation_id":"3826ad44-7d6d-4395-9796-201a044176c5","resolution":{"observed_at":"2026-08-06T11:34:20.306372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12430","last_updated":"2019-10-28T04:08:18Z","snapshot_observed_at":"2026-08-09T19:45:22.054528Z","submitted_at":"2019-10-28T04:08:18Z","title":"Differentiable Convex Optimization Layers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12430","snapshot_observed_at":"2026-08-06T11:34:20.442610Z","title":"Differentiable Convex Optimization Layers,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.442610Z"},"links":{"cited_paper":"/paper/1910.12430","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:8cb551d8feb2c085af3790f96fcb263d0f13e20bd6797394eb832a86c7e9276a","observation_id":"feab1efd-3c40-4dfb-9e6a-13241dd895b7","resolution":{"observed_at":"2026-08-06T11:34:20.442610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:26.570835Z","title":"OptNet: Differentiable Optimization as a Layer in Neural Networks,","venue":null,"work_id":"100228e5-e438-4cfb-8aca-a021774e42d5","year":null},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.590273Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:247cc65ac25e18063d4d42663eaecc1cd5b3eb26203c6eaa7de081126c94fc20","observation_id":"cb8b85ae-3c1d-4330-9859-32c9be6729d1","resolution":{"observed_at":"2026-08-06T11:34:26.677000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:26.304656Z","title":"Polymer grade transition control using advanced real-time optimization software,","venue":null,"work_id":"661c3c9f-1248-49f9-a953-e94ec813d639","year":2004},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.937196Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:e7b563d81c7a2882a20bb5c3b6c629803e135ff541461867de872261f7f190a5","observation_id":"8d8fd4b8-b759-4fe9-89ab-822f849d849d","resolution":{"observed_at":"2026-08-06T11:34:26.431238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:26.073120Z","title":"Polymer grade transition control via reinforcement learning trained with a physically consistent memory sequence-to-sequence digital twin,","venue":null,"work_id":"a9937a4a-cdc3-4ce4-9293-f8bd5c83a5d0","year":2023},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.154028Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:e95de99785ff7f39f9f415f62a41b4f87707975caf9fcfab1233c8cf40099cbb","observation_id":"f69c0586-8e19-4c5e-bd61-6aebe21db289","resolution":{"observed_at":"2026-08-06T11:34:26.193384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:25.834634Z","title":"A benchmark environment motivated by industrial control problems,","venue":null,"work_id":"51810df8-d104-4073-a412-a98b547029a4","year":2017},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.296216Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:bec0d053b4c0c4b662b5847639983754fc1485c4e816a31e5d9f6e4d4fda98d9","observation_id":"0ba9b1af-a386-4ca0-b2af-30e290e13a68","resolution":{"observed_at":"2026-08-06T11:34:25.938005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01708","last_updated":"2019-10-03T20:15:55Z","snapshot_observed_at":"2026-08-07T14:18:01.067346Z","submitted_at":"2019-10-03T20:15:55Z","title":"Benchmarking Batch Deep Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01708","snapshot_observed_at":"2026-08-06T11:34:21.442854Z","title":"Benchmarking Safe Exploration in Deep Reinforcement Learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.442854Z"},"links":{"cited_paper":"/paper/1910.01708","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:dd4f4eeae15521866c78c94138d6c0f93d381ed2e1849c209f0ec840cb94b253","observation_id":"9e3f99c7-1864-46b0-97c3-b30cd9b1c067","resolution":{"observed_at":"2026-08-06T11:34:21.442854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22093","last_updated":"2024-12-05T15:35:59Z","snapshot_observed_at":"2026-07-06T19:41:32.754401Z","submitted_at":"2024-10-29T14:49:26Z","title":"PC-Gym: Benchmark Environments For Process Control Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22093","snapshot_observed_at":"2026-08-06T11:34:21.584194Z","title":"PC-Gym: Benchmark Environments For Process Control Problems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.584194Z"},"links":{"cited_paper":"/paper/2410.22093","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:2213834a2fb63de4cdcf37e69f14cf807007742ff139057b98feac6120ce0c0b","observation_id":"ef465ad6-a07f-4c36-8315-f2958d7f4a43","resolution":{"observed_at":"2026-08-06T11:34:21.584194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.08792","last_updated":"2019-03-21T01:29:14Z","snapshot_observed_at":"2026-07-06T07:40:40.139119Z","submitted_at":"2019-03-21T01:29:14Z","title":"End-to-End Safe Reinforcement Learning through Barrier Functions for Safety-Critical Continuous Control Tasks","version":1},"cited_work":{"arxiv_id":"1903.08792","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.08792","snapshot_observed_at":"2026-08-06T11:34:23.645691Z","title":"End-to-End Safe Reinforcement Learning through Barrier Functions for Safety-Critical Continuous Control Tasks","venue":"cs.LG","work_id":"65137756-99d3-4a01-990a-52dc7ee8a819","year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:21.799762Z"},"links":{"cited_paper":"/paper/1903.08792","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:b45aee8c8c6169981524bb94f1fdef6352209548526e17d150b37810d0dc47be","observation_id":"eb487b2f-da8a-49e3-86a9-7867a95ee095","resolution":{"observed_at":"2026-08-06T11:34:23.746247Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:25.602809Z","title":"Offline reinforcement learning methods for real-world problems,","venue":null,"work_id":"3fa2233a-28b9-45b5-b443-b422b14a635e","year":2024},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.030643Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:cad550adbe3545a82f98b14066f9d8048f1818a9e0b3c75ced4781bebcdca17f","observation_id":"203fd197-31c7-47a0-99e1-e90cc81eff2c","resolution":{"observed_at":"2026-08-06T11:34:25.709828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-06T11:34:22.256553Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.256553Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:eb7a0862827ac33dbfab7299e637ed256cb64c4f5c783e2f8481102f0988c5af","observation_id":"dae50e37-7c3d-4137-9e10-976a79f04421","resolution":{"observed_at":"2026-08-06T11:34:22.256553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:22.483538Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.483538Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:ec39be053376558b2a89d7650b29e2e169c73bd715dbb8eadd5a18fa8203e2c8","observation_id":"fe6784ac-7e2f-4dcc-b52e-8fa68cd782bf","resolution":{"observed_at":"2026-08-06T11:34:22.483538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:25.420026Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction,","venue":null,"work_id":"88ff1205-944f-42cc-94c7-0b05ce2d1290","year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.678861Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:d5e83ad6dd46eb69eac93fa3795b6bf9b99479a6a5d27b31c2adf86449712e87","observation_id":"dce9edd8-9547-4c5a-8e76-9faad7a9eafd","resolution":{"observed_at":"2026-08-06T11:34:25.474108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.06461","last_updated":"2015-12-08T21:19:16Z","snapshot_observed_at":"2026-08-07T14:09:19.448496Z","submitted_at":"2015-09-22T04:40:22Z","title":"Deep Reinforcement Learning with Double Q-learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.06461","snapshot_observed_at":"2026-08-06T11:34:22.841058Z","title":"Deep Reinforcement Learning with Double Q-learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:22.841058Z"},"links":{"cited_paper":"/paper/1509.06461","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:62c1f8064e34055be9b37eacdc6e860a270ba277f4782580967343a4aaf05790","observation_id":"bf7f5e39-0013-46cb-9550-a3bcbe6650ab","resolution":{"observed_at":"2026-08-06T11:34:22.841058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:25.135873Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":"0a1c8ebc-e6a2-4b28-9248-e6147eb09005","year":2015},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.006757Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:578f6ce56e6d5b7632a36f855da33a6a863af81b652eb49b3b77425afc1269d8","observation_id":"f22b21aa-dcd3-4daa-a3f5-ab7a82bb7621","resolution":{"observed_at":"2026-08-06T11:34:25.347910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-06T11:34:23.213288Z","title":"Behavior Regularized Offline Reinforcement Learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.213288Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:e0a4b0917cb9c0ec3c04e627b4fcb99e1fccfdb004dadd009d52b226c280fac3","observation_id":"2d55ea92-d8cd-437c-b857-b4e5247f3f56","resolution":{"observed_at":"2026-08-06T11:34:23.213288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-06T11:34:23.313489Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.313489Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:1adc0a0b9c8bb18accf83cb9f216031f9a3fcc079df09255f934ab2a4e502d72","observation_id":"176e6c8e-b993-44a6-a594-cc0c91212bb0","resolution":{"observed_at":"2026-08-06T11:34:23.313489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:24.800522Z","title":"Comparative Study of Machine Learning and System Identification for Process Systems Engineering Dynamics,","venue":null,"work_id":"fd815786-9fe1-450e-a52b-5b7eadb1be7e","year":2025},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.365230Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:da1057032147da1ee51da11326f88bbf13d14704099c2e7ecac955115c9d93bf","observation_id":"09431ac7-47f5-49c0-a3bc-9ec13e86c089","resolution":{"observed_at":"2026-08-06T11:34:25.000267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:34:24.549358Z","title":"Polymerization reactor control using autoregressive-plus Volterra- based MPC,","venue":null,"work_id":"ff59e605-6876-48fe-bc17-f21e183c7853","year":1997},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:23.413516Z"},"links":{"citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:1e998791e3efac9cb295e0b9cf64c36e0d04cf8a8f1666a0e6ccae7a0ffbd53b","observation_id":"bc6fd994-6286-4aed-8703-3ba5690351f0","resolution":{"observed_at":"2026-08-06T11:34:24.645311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00443","last_updated":"2021-12-02T17:34:50Z","snapshot_observed_at":"2026-07-06T05:31:57.481191Z","submitted_at":"2017-03-01T18:58:48Z","title":"OptNet: Differentiable Optimization as a Layer in Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00443","snapshot_observed_at":"2026-08-06T11:34:20.749099Z","title":"Available: https://arxiv.org/abs/1703.00443","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:20.749099Z"},"links":{"cited_paper":"/paper/1703.00443","citing_paper":"/paper/2507.22640"},"observation_digest":"sha256:e8cf6ec17a343a8be9fa70c0625c1caf7e7b76579b47150a31c119ebdb6a0753","observation_id":"8ff2815d-9103-4710-be2f-c89055b741cc","resolution":{"observed_at":"2026-08-06T11:34:20.749099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22640","last_updated":"2025-07-30T12:58:02Z","latest_version":1,"primary_category":"eess.SY","snapshot_observed_at":"2026-08-07T21:43:52.097498Z","submitted_at":"2025-07-30T12:58:02Z","title":"Safe Deployment of Offline Reinforcement Learning via Input Convex Action Correction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2507.22640."}