{"as_of":"2026-08-11T01:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68b21237e3148455831b694164057d006bbbf84a37d9add331c0c9e2b6b7bc22","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:17:17.830361Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:29:01.297762Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T21:37:09.010677Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"cited_work":{"arxiv_id":"2502.02133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02133","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthesis of model predictive control and reinforcement learning: Survey and classifica- tion","venue":null,"work_id":"6a6f8c8a-8bb5-4d90-b113-b108636a472f","year":2025},"citing_paper":{"arxiv_id":"2504.02710","last_updated":"2026-04-10T12:29:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-03T15:50:47Z","title":"Rollout Then Optimize: A One-Step Newton Refinement of Learned Policies for Nonlinear Model Predictive Control","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-22T21:35:25.674483Z"},"links":{"cited_paper":"/paper/2502.02133","citing_paper":"/paper/2504.02710"},"observation_digest":"sha256:1f1248bb9ee64447feca5cf8a5730deb5f60696be40110c9cb8bb5246760edc9","observation_id":"857d1162-3c7b-4b87-baf2-a152826f638e","resolution":{"observed_at":"2026-05-22T21:37:09.015040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02133","snapshot_observed_at":"2026-08-06T16:29:01.297762Z","title":"Synthesis of model predictive control and reinforcement learning: Survey and classification, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-08-06T16:29:01.297762Z"},"links":{"cited_paper":"/paper/2502.02133","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:61dd60a8e0b674073359d90f3f04ae81fd1c44e35050e40123fe7fff8127a516","observation_id":"cb2d8736-993b-4dae-aa24-a28d07f3c039","resolution":{"observed_at":"2026-08-06T16:29:01.297762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02133","snapshot_observed_at":"2026-08-06T16:20:30.168942Z","title":"Available: https://arxiv.org/abs/2502.02133","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14025","last_updated":"2025-07-18T15:53:44Z","snapshot_observed_at":"2026-08-09T22:28:41.832617Z","submitted_at":"2025-07-18T15:53:44Z","title":"Reference-Free Iterative Learning Model Predictive Control with Neural Certificates","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T16:20:30.168942Z"},"links":{"cited_paper":"/paper/2502.02133","citing_paper":"/paper/2507.14025"},"observation_digest":"sha256:3f4e9d664c4ac18fdb08fb6ceef9f4f10d8c96f821d0de80d3ff99d7d20e996e","observation_id":"2ded37ca-4874-4412-9647-7be169524ec7","resolution":{"observed_at":"2026-08-06T16:20:30.168942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02133","snapshot_observed_at":"2026-08-03T21:20:38.197856Z","title":"Synthesis of model predictive control and reinforcement learning: Survey and classification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.15830","last_updated":"2026-07-20T14:51:40Z","snapshot_observed_at":"2026-08-10T05:07:44.096374Z","submitted_at":"2025-11-19T19:38:05Z","title":"Mini Amusement Parks (MAPs): A Testbed for Modelling Business Decisions","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T21:20:38.197856Z"},"links":{"cited_paper":"/paper/2502.02133","citing_paper":"/paper/2511.15830"},"observation_digest":"sha256:adb69ec19738f7e3962df254320ca5d117a24869dd52e79c055663d26ac19ced","observation_id":"41fbf113-e456-479b-b3b4-7682917e33f1","resolution":{"observed_at":"2026-08-03T21:20:38.197856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02133","snapshot_observed_at":"2026-07-31T23:37:32.474394Z","title":"Synthesis of model predictive control and reinforcement learning: Survey and classification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23930","last_updated":"2026-07-27T02:01:14Z","snapshot_observed_at":"2026-08-10T02:41:18.113526Z","submitted_at":"2026-07-27T02:01:14Z","title":"Bridging Reinforcement Learning and Optimal Control via Feasible Action Mapping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:32.474394Z"},"links":{"cited_paper":"/paper/2502.02133","citing_paper":"/paper/2607.23930"},"observation_digest":"sha256:a5db52ae7c6d24e8002d2bf135cb1835b0fddc9ad97abebfb69356084cb46747","observation_id":"06f682ac-07e5-4bab-a559-715e7fb69552","resolution":{"observed_at":"2026-07-31T23:37:32.474394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02133/citation-record","integrity":"/paper/2502.02133/integrity","json":"/paper/2502.02133/citation-record.json","paper":"/paper/2502.02133"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.405155Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.405155Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:d5b58df0d9c5492e54572b78240a26a301b511942225acbb9402d4402ffa816b","observation_id":"01aa8c90-f1de-47fe-87ff-c0565bc1d41b","resolution":{"observed_at":"2026-08-09T13:17:17.405155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.410474Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.410474Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:1b9358d5ebb65ece66ea6a587106fa243ca7579638c9be12e54e168879e059db","observation_id":"ef7da9f7-6206-4885-b565-1490ca1f34a8","resolution":{"observed_at":"2026-08-09T13:17:17.410474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.414844Z","title":"Bertsekas, Reinforcement Learning and Optimal Control , first edition ed","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.414844Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:d42addaebd1a7130873d7783dc7426af8b89b785e4c96b2adde9eb1497ff00f3","observation_id":"9d29d6ad-5fec-4bf6-97b4-c4c25aefdc04","resolution":{"observed_at":"2026-08-09T13:17:17.414844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.419046Z","title":null,"venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.419046Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:5a85e231f93ba920920f3a405edc37a20a05f059cbb697ec56818a9e3f198276","observation_id":"1c93e231-8f22-419e-8e0a-f08287125d09","resolution":{"observed_at":"2026-08-09T13:17:17.419046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.423478Z","title":"Review on model predictive control: an engineering perspective,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.423478Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:492df7fdfcc7b0bf50ec5a21246d5970a70391057ff677a24c55b2eba2bc29e7","observation_id":"2cd7f00b-b6f5-4059-9717-a9f63c53024f","resolution":{"observed_at":"2026-08-09T13:17:17.423478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.427793Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.427793Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:162731869ec1c84a6716c0a3c5c3f14c50f71bffdbe069bde94bead88089a5c4","observation_id":"4948ccfb-ec35-4243-bf26-3ed4e0d792cb","resolution":{"observed_at":"2026-08-09T13:17:17.427793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.432737Z","title":"Outracing champion Gran Turismo drivers with deep reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.432737Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:54266177017d7f8416464786ef04ff7926eeb49b727343d409338d8784710bdf","observation_id":"c6501d56-3a14-4707-9252-995900e4e07f","resolution":{"observed_at":"2026-08-09T13:17:17.432737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.437069Z","title":"Relations between Model Predictive Control and Reinforce- ment Learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.437069Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:c4480195bdae9be80a3649fda9f9867bd516d9b6089d672ddd17121bd33888d9","observation_id":"0554fa84-3f12-478b-9ecf-70e5f7e9ab62","resolution":{"observed_at":"2026-08-09T13:17:17.437069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.441534Z","title":"Safe Learning in Robotics: From Learning-Based Control to Safe Reinforcement Learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.441534Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:b54ce4a1103f7d86b33108792578bb0fe7e981db489c2bdf9c287e3da1637327","observation_id":"90f8848e-a7f3-4d53-be0e-c2c60fe2fd40","resolution":{"observed_at":"2026-08-09T13:17:17.441534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.445907Z","title":"A Tour of Reinforcement Learning: The View from Contin- uous Control,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.445907Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:72c826c7d4160223629a12b61c477bcc86e6520d59cd157a16d6c70ab6b61cc1","observation_id":"3bb99236-ba92-43ae-83d1-bcbd267a8fe1","resolution":{"observed_at":"2026-08-09T13:17:17.445907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.450041Z","title":"Machine learning for combinato- rial optimization: A methodological tour d’horizon,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.450041Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:0f1895f5f95d085b88a93114ee2b87445fd2a08fd59812f42481f69314938967","observation_id":"b1a1bb19-ccaa-4b64-8e61-0295a4a7acde","resolution":{"observed_at":"2026-08-09T13:17:17.450041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.454352Z","title":"Bertsekas, Lessons from AlphaZero for Optimal, Model Predictive, and Adaptive Control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.454352Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:98aa508ec9b56100168680c50e4e229b7c9d8bceabbc471dfd1eb42d76dd8581","observation_id":"fea7bc37-8206-4856-a718-db8da8e59e90","resolution":{"observed_at":"2026-08-09T13:17:17.454352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.458493Z","title":"Newton’s method for reinforcement learning and model predic- tive control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.458493Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a010c6e57c23724ea3a12c6f57c65657ecc0244ff5583d87c3bad2dc2413f2da","observation_id":"1c8a5d04-80ff-4b15-afbe-ac722a37f71f","resolution":{"observed_at":"2026-08-09T13:17:17.458493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01815","last_updated":"2017-12-05T18:45:38Z","snapshot_observed_at":"2026-08-02T00:39:04.960144Z","submitted_at":"2017-12-05T18:45:38Z","title":"Mastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01815","snapshot_observed_at":"2026-08-09T13:17:17.462579Z","title":"Mastering Chess and Shogi by Self-Play with a Gen- eral Reinforcement Learning Algorithm,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.462579Z"},"links":{"cited_paper":"/paper/1712.01815","citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:2c4025b3ef26efeb4638f56ef56004013af0b2776b1733593f605098f3230da4","observation_id":"b2531ecd-f9c3-43ff-b4dd-243733311256","resolution":{"observed_at":"2026-08-09T13:17:17.462579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.467128Z","title":"Mastering the game of Go without human knowledge,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.467128Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:2e316d21f868f5ef9effff5c84e63ac22a3870331f478f96d877c892e9399a66","observation_id":"c2b966b7-d7e6-4384-b661-8e7d244fc7e2","resolution":{"observed_at":"2026-08-09T13:17:17.467128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.471555Z","title":"Learning- based model predictive control: Toward safe learning in control,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.471555Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:8a438ad40f2ef8002b1642e7e5247e5c3303ee17659680faeeb84e448aea743d","observation_id":"0b4aec55-21a1-4f89-8f8f-6d0bce7e7fa9","resolution":{"observed_at":"2026-08-09T13:17:17.471555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.476018Z","title":"Fusion of Machine Learning and MPC under Uncertainty: What Advances Are on the Horizon?","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.476018Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:0319af76dca483ea13598fb881c2e940643da5a21eaedf92a9ad41b068ad23b2","observation_id":"8ae9cf4f-781e-41bb-b28b-eb96d0aea9dc","resolution":{"observed_at":"2026-08-09T13:17:17.476018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.479994Z","title":"Integrating Machine Learning and Model Predictive Control for automotive applications: A review and future directions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.479994Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:65be47b856ac40d1d3f0ff7a7952eaf4cd744543cbf7daef45400d21746b269d","observation_id":"b5167bcd-6234-405d-a707-1048362d2886","resolution":{"observed_at":"2026-08-09T13:17:17.479994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.484085Z","title":"Building Energy Management With Reinforcement Learning and Model Predictive Control: A Survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.484085Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:9fa46976f844ab8c0ac406d9cc135b609bbe68bb73ee51b8e78e09a957bbc3f2","observation_id":"7a3f24db-df17-44b9-9960-4b52b2d7e2ad","resolution":{"observed_at":"2026-08-09T13:17:17.484085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.02057","last_updated":"2019-07-03T17:53:02Z","snapshot_observed_at":"2026-08-09T13:33:46.291085Z","submitted_at":"2019-07-03T17:53:02Z","title":"Benchmarking Model-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.02057","snapshot_observed_at":"2026-08-09T13:17:17.488166Z","title":"Benchmarking Model-Based Rein- forcement Learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.488166Z"},"links":{"cited_paper":"/paper/1907.02057","citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:6fca926a2ffe6cb033838c37631013c212fb18e86057bd55cd8cd224813c078c","observation_id":"902b0a6c-cc89-4868-90be-e1b82486db62","resolution":{"observed_at":"2026-08-09T13:17:17.488166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.492516Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.492516Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:bae4de7272832fe932b3d09fd92ab5a06314beea25d43b70f0a5f61dadb523bb","observation_id":"4e252200-7d09-4377-ab18-ca3b5a9afb2b","resolution":{"observed_at":"2026-08-09T13:17:17.492516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.496573Z","title":"Dynamic programming,","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.496573Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:cff7081f074e37f507418819478ceabcee322cccd4d4fee74b81ca1c5a4801ec","observation_id":"03ceb045-b2ca-4746-b959-98195b993011","resolution":{"observed_at":"2026-08-09T13:17:17.496573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.500368Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.500368Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:0d28647b5290343f25a5d6b76d6869909e201684dd3d70996ae5a4f2d51df8b0","observation_id":"a21225f8-596d-402e-bc27-ffb7810f0fec","resolution":{"observed_at":"2026-08-09T13:17:17.500368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.504542Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.504542Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:0af32f9b540ec3d31756abbe673a71629b316aa8ccfc20d08ef4784da3037d33","observation_id":"3b7209d9-2c93-466a-b632-73a1f252010c","resolution":{"observed_at":"2026-08-09T13:17:17.504542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.508894Z","title":"Q-learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.508894Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a43942e777d5601f16d39cece9c9033a999f58fba0f7a826804281fb962a1e56","observation_id":"f6148136-a7b7-494b-89f7-55b6bcedc537","resolution":{"observed_at":"2026-08-09T13:17:17.508894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.512951Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.512951Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:b883e52b818b0d247b7b43fbad15a224d42260623e1843aec67e149457c73a11","observation_id":"1be4f286-69d5-45ab-a616-94d20380739c","resolution":{"observed_at":"2026-08-09T13:17:17.512951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.516924Z","title":"Deterministic policy gradient algorithms,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.516924Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:f671ddb32563cbe9af839bfa9caed074b3791b16ebb60844adfbf8205d897c25","observation_id":"940a4fc8-751f-4a05-8740-833ab42559c6","resolution":{"observed_at":"2026-08-09T13:17:17.516924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.521028Z","title":"Addressing function approximation error in actor-critic methods,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.521028Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:d0efbffd522c2aed65b191b6ea63ada4e6d7cc55618780a1c7f3748641bb378b","observation_id":"511d1342-c8d6-401b-acb2-1dce2fdc0450","resolution":{"observed_at":"2026-08-09T13:17:17.521028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.525253Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.525253Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:0e16799f99b596f8cdb328f43043233dcb4902b0624cc12512625dd32229a551","observation_id":"5c625c81-3b28-4e5b-8f4c-087acb3f61fa","resolution":{"observed_at":"2026-08-09T13:17:17.525253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11793","last_updated":"2023-06-14T13:43:44Z","snapshot_observed_at":"2026-08-09T16:39:39.415250Z","submitted_at":"2023-02-23T06:13:51Z","title":"Revisiting the Gumbel-Softmax in MADDPG","version":2},"cited_work":{"arxiv_id":"2302.11793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.11793","snapshot_observed_at":"2026-08-09T13:17:18.894993Z","title":"Revisiting the Gumbel-Softmax in MADDPG","venue":"cs.LG","work_id":"99745f95-13ed-4831-9046-d47199e3e02d","year":2023},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.529604Z"},"links":{"cited_paper":"/paper/2302.11793","citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:638683ac43151fb51547a0740b4baa7a8d1d4e1584e9d8589b7b62dc6a1f915d","observation_id":"3b333697-9177-4a43-bb4b-9f93462a30c6","resolution":{"observed_at":"2026-08-09T13:17:18.899985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.534064Z","title":"Efficient BackProp,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.534064Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:68c724ee940cc966bdd3401677ef909c0a4d6b0c608154fa8273acffdada8405","observation_id":"38616b2f-63f6-4c00-b7f6-f50004cfad33","resolution":{"observed_at":"2026-08-09T13:17:17.534064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.538254Z","title":"Continuous control with deep reinforcement learning,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.538254Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:14932c6401dddf80d2ad1caea027f093b8ee750534ae5a12d539e25926c10645","observation_id":"f6c5905c-93de-4409-a13c-5cb83eb5c0d7","resolution":{"observed_at":"2026-08-09T13:17:17.538254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-09T13:17:17.542720Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.542720Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:6bbec3304b6922fdfd788b2086aa60b30934cc5b1d10ca3ddb5f63ec0bee7db3","observation_id":"0e81eb54-2f24-43ca-83d9-16e8f2d4e284","resolution":{"observed_at":"2026-08-09T13:17:17.542720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-09T13:17:17.547207Z","title":"Trust region policy optimization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.547207Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a397c6ddc8c124d0a00d28638989e5693dff94a0eaa3eb8d3193707d27a8de1d","observation_id":"9195df73-56e4-43e5-b93a-d99d2e5e9db9","resolution":{"observed_at":"2026-08-09T13:17:17.547207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.551810Z","title":"High- Dimensional Continuous Control Using Generalized Advantage Esti- 29 mation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.551810Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:f64cac26ee2793db52fad7e427ce0801648aab56f83a24d1a462692d90ec833c","observation_id":"ad41ef4a-be59-41e5-9a9c-481208f6c92f","resolution":{"observed_at":"2026-08-09T13:17:17.551810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.556033Z","title":"Mirror learning: A unifying framework of policy optimisation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.556033Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:c8c56b4118d5dd873021b4c70bbb02f38471d13e6c7a339a0c990a8ffc71555b","observation_id":"ff7862d1-e2e8-4b9d-8e80-15ab79c37ed4","resolution":{"observed_at":"2026-08-09T13:17:17.556033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-09T13:17:17.560410Z","title":"Soft Actor- Critic Algorithms and Applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.560410Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:13745d09231664ca08a900724a705f8740cd784684b22d8510fa8b15580e7c23","observation_id":"323a4545-b5a8-4261-895f-190b9078be3c","resolution":{"observed_at":"2026-08-09T13:17:17.560410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.565160Z","title":"Maximum entropy inverse reinforcement learning,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.565160Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:da2fbca5e2578e42a6854d1c293678040cc6b54fc7676011a08e31954b6a445a","observation_id":"8f6119e0-5053-436b-914f-b4c4c9588c5e","resolution":{"observed_at":"2026-08-09T13:17:17.565160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.569492Z","title":"OffCon3: What is state of the art anyway?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.569492Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:029476664ad918fb524521395a86ec57c346ee0a12914a86955a8f83b0e77412","observation_id":"81856dc3-3c32-4750-9d02-41cb49cfd6fc","resolution":{"observed_at":"2026-08-09T13:17:17.569492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.573595Z","title":"Maximum Entropy RL (Provably) Solves Some Robust RL Problems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.573595Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:2e276f60530c4098397bc47c73e1f567999478d888f0c6b63a0442c4d7f707a6","observation_id":"16b7e943-4926-467a-9dea-87d45dc780b8","resolution":{"observed_at":"2026-08-09T13:17:17.573595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.578254Z","title":"Essentially Sharp Estimates on the Entropy Regularization Error in Discounted Markov Decision Processes,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.578254Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a15c322ee6d60687f2382b52d94f5c92d4273a5f59aa97f3aec2ffd99c4eb651","observation_id":"3d21033a-5d0d-41ff-844a-e256470b6375","resolution":{"observed_at":"2026-08-09T13:17:17.578254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.582386Z","title":"Gr ¨une and J","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.582386Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:6dc218b72cf0c27ddef4f5d3246c93977c43b512cd7c075ac7ad410e58bdbf2a","observation_id":"1cb1493a-3171-4fd1-93d4-b1de0ee51e1f","resolution":{"observed_at":"2026-08-09T13:17:17.582386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.586771Z","title":"Economic receding horizon control without terminal constraints,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.586771Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:b282269f9ea72a9f2166c0d62638a721304a6eb159e46085b37f5dcadf80b270","observation_id":"3861b51c-14ce-4742-b096-4553b9e24c33","resolution":{"observed_at":"2026-08-09T13:17:17.586771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.590808Z","title":"Stabilizing Receding- Horizon control of nonlinear time varying systems,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.590808Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:4e34cba3ea989aad2444af1c30ff5ebdaf14e70f9807e900ed82214c9bffdf42","observation_id":"8daffbd9-8027-4cc7-a6bc-8b61404bf2f0","resolution":{"observed_at":"2026-08-09T13:17:17.590808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.594856Z","title":"Stabilizing nonlinear receding horizon control via a nonquadratic terminal state penalty,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.594856Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:b7239ed51e487bb6f44e26edd986aaf297bf6ad2885ae14ae195a0f6e0199be1","observation_id":"a33212f4-7ce4-4a5d-b250-1d4696bf135b","resolution":{"observed_at":"2026-08-09T13:17:17.594856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.599112Z","title":"Online NMPC of a looping kite using approximate infinite horizon closed loop costing,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.599112Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:da199f8f7f9ee7716d948d4a1c00966b3309025aa3a670c01e9f5e6fa0847dcf","observation_id":"b5862540-af44-4581-b416-b39f623c9ede","resolution":{"observed_at":"2026-08-09T13:17:17.599112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.603166Z","title":"Efficient NMPC of unstable periodic systems using approximate infinite horizon closed loop costing,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.603166Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:f610930f4a1a73dcdab34c906450fdc7716f567a3505e21ef411e5839944658b","observation_id":"b31e3b0a-7a11-4063-a2d5-7d875950aa29","resolution":{"observed_at":"2026-08-09T13:17:17.603166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.607295Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.607295Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:308d895c797b862d3b2d72860f31c2a40867f0b0c9b3475f09942fb0ecc9a6c2","observation_id":"f576eaf2-ecdb-4b3d-b2a0-81351a4e7f73","resolution":{"observed_at":"2026-08-09T13:17:17.607295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.611734Z","title":"Nocedal and S","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.611734Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a2108fe0350b0c4b8986ecbdbc927b9f96d8f1de03244a083beffe16137ccc6d","observation_id":"0fe03644-e410-4d0b-b458-08279406800d","resolution":{"observed_at":"2026-08-09T13:17:17.611734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.615923Z","title":"Robust Constraint Satisfaction: Invariant Sets and Predictive Control,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.615923Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:fbd8adb14b1a52616c8ac777a4cf7d5d453aacdc6955400169b01e8cb8d62c3b","observation_id":"e2d2bb15-2bb0-4deb-b56c-c0f39fa97e52","resolution":{"observed_at":"2026-08-09T13:17:17.615923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.620064Z","title":"Model predictive control with discrete actuators: Theory and application,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.620064Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:c77ba07afee9ec7f2792a85dcd50aefa52e2434ac07f923f9eca860aa5426ce3","observation_id":"6437b2d8-0eff-4ae0-8e6f-51b37a2df640","resolution":{"observed_at":"2026-08-09T13:17:17.620064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.624043Z","title":"Stochastic Model Predictive Control: An Overview and Perspectives for Future Research,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.624043Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:62bde1af51b94a8233178ffc7201ded8c43146413f9bb72d8d6c1f4fa4587b8d","observation_id":"c658f320-48d4-4e63-af28-d455d691cbd0","resolution":{"observed_at":"2026-08-09T13:17:17.624043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.628643Z","title":"Kouvaritakis and M","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.628643Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:c7fd7b4184fc5d25f344f85b1ebc421411b0a1f4af58617b68de82dbdcdc4e14","observation_id":"6b266b92-738c-408c-a7de-0bc9d3e4e2eb","resolution":{"observed_at":"2026-08-09T13:17:17.628643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.632650Z","title":"Shapiro, D","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.632650Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:9e70186641fda895fc40039a08461a22e75fd70aebc499c7d0d33d30b04227b4","observation_id":"9a74d86c-9f84-475f-aedc-a967439ff011","resolution":{"observed_at":"2026-08-09T13:17:17.632650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.636675Z","title":"The Scenario Approach to Robust Control Design,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.636675Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:154b1573c37bbea999c0cd6c95b83b0abd988f59711003173ff0c233e3eca101","observation_id":"a36eb98e-f0d9-46cc-b132-a874727787f7","resolution":{"observed_at":"2026-08-09T13:17:17.636675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.640875Z","title":"Robust model predictive control using tubes,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.640875Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:fb47e2f457ea39e5ccfe0d691f80492955be8487f8459b2e43e3115b69ff2d5c","observation_id":"eab90caf-d6f9-4a44-ad61-eeaf80f5d96c","resolution":{"observed_at":"2026-08-09T13:17:17.640875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.645154Z","title":"Tube-based robust nonlinear model predictive control,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.645154Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:36a7e42b2cd230be625a7ed24003bf56ac73be18315ade2aedcc7ee19a7ed048","observation_id":"c07ca314-4f79-458e-89be-54ff5caa1497","resolution":{"observed_at":"2026-08-09T13:17:17.645154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.649298Z","title":"Neural network dynamics for model-based deep reinforcement learning with model- free fine-tuning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.649298Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:420cd4422e1346bc21f471a1892b3ad077a002a85871a7198baa2f517ff08dc5","observation_id":"4a63e481-3716-49cd-bc41-2f15e2eb4721","resolution":{"observed_at":"2026-08-09T13:17:17.649298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.653528Z","title":"A dual Newton strategy for tree-sparse quadratic programs and its implementation in the open-source software treeQP,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.653528Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:eeed9c13cb7ff67ad8fdad113756f078b2e5aa19a20c6a447b91201d393e5ea2","observation_id":"9085826f-caec-4a30-a5e8-e8497316b76c","resolution":{"observed_at":"2026-08-09T13:17:17.653528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.657744Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.657744Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:79d5dca2769aff2ffd25cdc6640d24b14f875ae585bbae8be6d0c29ba3565d5b","observation_id":"5f9190d5-a9c8-405e-b749-2a77a7db0394","resolution":{"observed_at":"2026-08-09T13:17:17.657744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.661961Z","title":"Robust Optimization of Dynamic Systems,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.661961Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:64a9af00d2a8fd65313feb0ad4100f768fb27da25f01cbe23f9054423d3a969e","observation_id":"5d250aa5-ac40-4b99-93e4-702a0b49cf64","resolution":{"observed_at":"2026-08-09T13:17:17.661961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.666219Z","title":"A Positive Definiteness Preserving Discretization Method for nonlinear Lyapunov Differential Equations,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.666219Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:763e68c2101bf38e97db3c4c3b3397676d082a4fdc77a65967072639b7256a7d","observation_id":"751ce798-7826-42a6-a60b-cca5b91b0809","resolution":{"observed_at":"2026-08-09T13:17:17.666219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.670410Z","title":"Robust MPC via min-max differential inequalities,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.670410Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:55605679da157e6c7454c68107868b4db8053eb55b3dddc24f3a4f7c82d7c912","observation_id":"c291a22d-d0a4-46b6-98e8-71bae958e46d","resolution":{"observed_at":"2026-08-09T13:17:17.670410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.675362Z","title":"Parameterized Tube Model Predictive Control,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.675362Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:aceff764d1a95e41070157dfbd7f1a226dc0705f0a29c47fb6ed939216010fcb","observation_id":"60036c24-e12c-4699-9cdf-13218363b932","resolution":{"observed_at":"2026-08-09T13:17:17.675362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.679946Z","title":"Robust Model Predictive Control,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.679946Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:0d8924dd36f7d97ae5727664e1c694b4bb60bd0bd0d3eae13fb70d5f6bb599f9","observation_id":"35963251-eafc-435c-a71f-70d7fc4c14b5","resolution":{"observed_at":"2026-08-09T13:17:17.679946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.684246Z","title":"Robust Tube MPC for Linear Systems With Multiplicative Uncertainty,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.684246Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:50c19cc2eef4abf672f2acbe2e4ad448caf064e67764ff25f71a3ac36374f5cb","observation_id":"d3edb79e-b905-432f-978d-cbf0f366869e","resolution":{"observed_at":"2026-08-09T13:17:17.684246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.688537Z","title":"Homothetic Tube Model Predictive Control for Nonlinear Systems,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.688537Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:8749059663ccbdcaa65cc7fa9eebe951de69c3330c3ac3ac04245c6f9ddf0531","observation_id":"c5d9943b-3531-46e0-b4b3-97f99435b3b2","resolution":{"observed_at":"2026-08-09T13:17:17.688537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.692825Z","title":"Configuration- Constrained Tube MPC,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.692825Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a7bc4f7415d0ebba766a65efe46227271350148a519f945214757447e177a9df","observation_id":"a20d618b-1b6d-4c2e-90f5-465dbcd84adf","resolution":{"observed_at":"2026-08-09T13:17:17.692825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.697072Z","title":"Ad- justable robust solutions of uncertain linear programs,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.697072Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:ab0fd4e505137a1f4e8faf99f02bbbd3a1580ee65491a9c68db8f991b8567f48","observation_id":"5f67956f-6282-4a7c-a129-b39c4e2fde12","resolution":{"observed_at":"2026-08-09T13:17:17.697072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.701213Z","title":"A receding-horizon regulator for nonlinear systems and a neural approximation,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.701213Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:feddb444b1ec2720f8766ba4f550b49cc49b0412c9fb43e57adb45a22b80364b","observation_id":"a69da858-c797-4b95-a898-cf243dea4ba3","resolution":{"observed_at":"2026-08-09T13:17:17.701213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.705522Z","title":"Open-loop and closed-loop robust optimal control of batch processes using distributional and worst-case analysis,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.705522Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:1fd17a36a474c0e62aeb1a5577b71286687f76597e78ab1d60d537bd987e9724","observation_id":"7d28ac86-4a07-40ec-ad95-fe6d54e8cc53","resolution":{"observed_at":"2026-08-09T13:17:17.705522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.709646Z","title":"An Efficient Algorithm for Tube-based Robust Nonlinear Optimal Control with Optimal Linear Feedback,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.709646Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:65b67d70831f99bcfc80df467925241b5eb31ac5a59d4767d3a9d7b996f570f3","observation_id":"c2da0e53-fff9-4bcd-9f59-6bd620813977","resolution":{"observed_at":"2026-08-09T13:17:17.709646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.714235Z","title":"Optimization over state feedback policies for robust control with constraints,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.714235Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:76847083e6a3fa1ada311a5ee60a0883700cfa9ecf85fedd3152997b75e942d9","observation_id":"5d709f2d-d760-49ea-bd5f-af817fd19b85","resolution":{"observed_at":"2026-08-09T13:17:17.714235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.718746Z","title":"Min-max feedback model predictive control for constrained linear systems,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.718746Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:871ae7b6030ea8636c2fc9575211728def99a57079bc7e760af6ba074a7ee427","observation_id":"3a30cfad-de25-4125-b9af-5dc5f60e6067","resolution":{"observed_at":"2026-08-09T13:17:17.718746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.722947Z","title":"Formulation of Closed Loop Min-Max MPC as a Quadrati- cally Constrained Quadratic Program,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.722947Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:ee19dc34fbc8814a5042fc8ff1e7c757a01d4fab0b3059d610753032463974f5","observation_id":"b7528c9f-b8f3-426b-9e16-92780bf3d059","resolution":{"observed_at":"2026-08-09T13:17:17.722947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.727141Z","title":"Mixed-integer optimization-based planning for autonomous racing with obstacles and rewards,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.727141Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:00f846859e1ec1580da6d18dca42c1b63a7c503dde1e948dec3f5df7f4525f30","observation_id":"a14a5958-777a-4cfe-9095-e80a3074e998","resolution":{"observed_at":"2026-08-09T13:17:17.727141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.731543Z","title":"Numerical Methods for Optimal Control of Nonsmooth Dynamical Systems,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.731543Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:ecd984f38981cbd936afe99e17205b18b7f011cc0c230b430acc4b761eaf4fa7","observation_id":"93964378-e6bc-4c23-a765-5d9894859053","resolution":{"observed_at":"2026-08-09T13:17:17.731543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.735682Z","title":"Dynamic Programming and Suboptimal Control: A Survey from {ADP} to {MPC}*,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.735682Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:bbc548b3fb5ecee03c667c142da229a57262d77ebed2566847dabbfebb45ce22","observation_id":"d320df11-eb55-48a5-8769-91b729dd4e2f","resolution":{"observed_at":"2026-08-09T13:17:17.735682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.739731Z","title":"On the infinite horizon performance of receding horizon controllers,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.739731Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:19add774bd5ec827a5edc4b2bd071a851dc34d3a4671379bd5bd606cfe2b39d8","observation_id":"cfa4d90e-8544-427c-8d1b-8e352d9aaeae","resolution":{"observed_at":"2026-08-09T13:17:17.739731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.743942Z","title":"On the Finite-Time Behavior of Suboptimal Linear Model Predictive Control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.743942Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:b05e8bb2348ebc111934638830dfcd8a1e6155a4fd7c0850efdc901cb68e0ac2","observation_id":"78058209-7dd1-4eef-8b10-e49dbd18cceb","resolution":{"observed_at":"2026-08-09T13:17:17.743942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.748789Z","title":"Performance Bounds of Model Predictive Control for Unconstrained and Constrained Linear Quadratic Problems and Beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.748789Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a0f63abf6c02a868cc0b28c60e0b4659ec3664dc190b6bbcb80399e5dc0a9599","observation_id":"2d5e7ed8-7194-4a80-abab-94b5f535d254","resolution":{"observed_at":"2026-08-09T13:17:17.748789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.752987Z","title":"An Efficient Method to Estimate the Suboptimality of Affine Controllers,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.752987Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:6ffc6fba597e3e8c8744384e4cbefc53efca33c578cb79789f8ea00274a68ad0","observation_id":"c91dfbf6-28fc-4d05-9b3b-81e141290cb1","resolution":{"observed_at":"2026-08-09T13:17:17.752987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.756956Z","title":"Stochastic Control for Small Noise Intensities,","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.756956Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:ca43bd1640d5f0d4d966a81098c10a2d4db2f55b734a65dce3dbdf6986bf8f94","observation_id":"c904e809-6608-4c98-a170-5a32a078ce72","resolution":{"observed_at":"2026-08-09T13:17:17.756956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.761109Z","title":"Fourth-order suboptimality of nominal model predictive control in the presence of uncertainty,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.761109Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:81e6732871609581029e5e21a8cc43e7d2e7c46f5450ec61ca1667487b0c6f12","observation_id":"c3c0391d-937e-490f-a67f-2a49d4014bfb","resolution":{"observed_at":"2026-08-09T13:17:17.761109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.766325Z","title":"Bounded-Regret MPC via Perturbation Analysis: Prediction Error, Constraints, and Nonlinearity,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.766325Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:2aa4ae4cd1ba85001aea33d1f193edde23eee15970a13e311e9a580b051b8a2b","observation_id":"ed80b39a-76b7-4d9c-9661-41bba52c3dbb","resolution":{"observed_at":"2026-08-09T13:17:17.766325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.770891Z","title":"A Quasi-Infinite Horizon Nonlinear Model Predictive Control Scheme with Guaranteed Stability,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.770891Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:f1cdf3d958a45e6ddd1967fea38d631fa4882e81b81dce2bd4601aa975f500fe","observation_id":"ed4cf5b1-3195-42be-b680-4a0d930df50c","resolution":{"observed_at":"2026-08-09T13:17:17.770891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.775008Z","title":"Con- strained model predictive control: Stability and optimality,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.775008Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:695a1e3f4d7e2adc962c2a2e1eb2093abba91fec56cc7907ff064db8433a2dc5","observation_id":"0895b19c-7c31-46cb-91dd-7293c9a4357d","resolution":{"observed_at":"2026-08-09T13:17:17.775008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.779196Z","title":"Input-to-State Stability: A Unifying Framework for Robust Model Predictive Control,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.779196Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:e673dd028d60ac1e4041b978b87740ceb85d433a516fd27e23bfb19cbd56fe8e","observation_id":"307d0e33-fc70-412e-9374-fc878c0d93df","resolution":{"observed_at":"2026-08-09T13:17:17.779196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.783862Z","title":"NMPC without terminal constraints,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.783862Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:c0947f2b63c366fdea0f28f1ec7302cdbd00131fe639dabd1e3bf342caf7729e","observation_id":"924ecf67-3d14-4e36-a68e-41f33cf668f2","resolution":{"observed_at":"2026-08-09T13:17:17.783862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.788141Z","title":"Oops! I cannot do it again: Testing for recursive feasibility in MPC,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.788141Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:d34dadab512d26c35546ac22d1ed9758bf2ac935b18faa1fe11d80deb170ebbc","observation_id":"5862b4c8-2683-4582-bf75-d00847d59a36","resolution":{"observed_at":"2026-08-09T13:17:17.788141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.792367Z","title":"An apologia for stabilising terminal conditions in model predictive control,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.792367Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:42e09d3b63cd8333df5864235394fe470336475b09140205633005418e6252a2","observation_id":"a7d668de-962b-4846-96ee-c8eae688aa04","resolution":{"observed_at":"2026-08-09T13:17:17.792367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.796404Z","title":"Discrete-time Stability with Perturbations: Application to Model Predictive Control,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.796404Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a497fef86edefb370ac3d858c5ab36cdd49decc3e55afe231da6d78caf4e4907","observation_id":"7c07463a-a2aa-4e19-9f9d-d2fc16323ed1","resolution":{"observed_at":"2026-08-09T13:17:17.796404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.800740Z","title":"On the Robustness of Receding-Horizon Control with Terminal Constraints,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.800740Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:a5e607efc9a6142a18a10b123d164988a530cfac6b6ef0ee71fc98c676f65ad7","observation_id":"ddb8c6aa-255e-4d1a-a55e-77c6332b03fa","resolution":{"observed_at":"2026-08-09T13:17:17.800740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.804973Z","title":"Stability margins of nonlinear receding- horizon control via inverse optimality,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.804973Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:158f5eb1669e8eec36bceb440ca7e193f7d3c7fe6d2035dea70274477e690f95","observation_id":"4303b86a-00b5-4915-be55-a53c784e702a","resolution":{"observed_at":"2026-08-09T13:17:17.804973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.809222Z","title":"Inherent Stochastic Robustness of Model Predictive Control to Large and Infrequent Disturbances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.809222Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:833aa3b11f3cd2bbe73f8297bc03b8d493d8b67d3ade47441a2befb17d18337f","observation_id":"21d34839-d98b-4ee9-866b-99bac9547624","resolution":{"observed_at":"2026-08-09T13:17:17.809222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.813314Z","title":"Examples when nonlinear model predictive control is nonrobust,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.813314Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:147a741a50f89be07d37e8b182df57cd939939b609d7b2de20b079811f45a0f0","observation_id":"8798d373-aa04-421e-b068-e22ff9663082","resolution":{"observed_at":"2026-08-09T13:17:17.813314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.817834Z","title":"Inherent robustness properties of quasi-infinite horizon nonlinear model predictive control,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.817834Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:aa1c683c2c7e30390c029837b29b7594a6fb00343acbbb201d0168cc5f14c33c","observation_id":"5acc5e61-e82f-409e-94b3-b2432d8945b5","resolution":{"observed_at":"2026-08-09T13:17:17.817834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.822011Z","title":"On the Inherent Distributional Robustness of Stochastic and Nominal Model Predictive Control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.822011Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:4abc33121044a53fb441f837a27974b481e604c76c1dd7147d216a38d1e4de8d","observation_id":"7965e72a-b11f-44a6-bd39-95fb6d38cba4","resolution":{"observed_at":"2026-08-09T13:17:17.822011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.826201Z","title":"Suboptimal Model Predictive Control (Feasibility Implies Stability),","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.826201Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:341c0c111ada4e1b6b88bc1a0deb0061938e04ac7ab3f29cd2773637b29545ff","observation_id":"383b6cd3-454f-4dec-904c-7bca3aae8004","resolution":{"observed_at":"2026-08-09T13:17:17.826201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T13:17:17.830361Z","title":"Nominal Stability of the Real-Time Iteration Scheme for Nonlinear Model Predictive Control,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-09T13:17:17.830361Z"},"links":{"citing_paper":"/paper/2502.02133"},"observation_digest":"sha256:f6a540777affe1845545b50d9192666a2392affbc25ce103ae44acf57e367a3c","observation_id":"459a8858-a21c-4c27-a47a-a0cad6220eeb","resolution":{"observed_at":"2026-08-09T13:17:17.830361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02133","last_updated":"2025-02-04T09:06:07Z","latest_version":1,"primary_category":"eess.SY","snapshot_observed_at":"2026-08-10T00:07:42.404958Z","submitted_at":"2025-02-04T09:06:07Z","title":"Synthesis of Model Predictive Control and Reinforcement Learning: Survey and Classification"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 5 inbound Pith citation observations for arXiv:2502.02133."}