{"as_of":"2026-08-10T06:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:049e846ac641bd2c632589630bff84e6415d20fa82d7c6ab5fc16a75f523b6a2","coverage":[{"denominator":197,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:28:55.851695Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:14:58.076642Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:17:30.887576Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"cited_work":{"arxiv_id":"2507.13491","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.13491","snapshot_observed_at":"2026-07-03T01:17:30.887576Z","title":"arXiv preprint arXiv:2507.13491 (2025)","venue":null,"work_id":"7aea9ea1-e839-4945-b0ac-444e6e66eced","year":2025},"citing_paper":{"arxiv_id":"2606.10167","last_updated":"2026-07-31T12:05:24Z","snapshot_observed_at":"2026-08-05T23:10:46.115458Z","submitted_at":"2026-06-08T20:53:11Z","title":"FlexPath: Adapting Learned Connectivity Guidance to Path Preferences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T16:41:29.124842Z"},"links":{"cited_paper":"/paper/2507.13491","citing_paper":"/paper/2606.10167"},"observation_digest":"sha256:14ef1b1875066f55d03323c76a5ce2dcf07b6b35e3b9b4ca533d93708f393e51","observation_id":"b10582df-bbf4-4826-8a45-9d474592ab6d","resolution":{"observed_at":"2026-07-03T01:17:30.888870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13491","snapshot_observed_at":"2026-08-03T02:14:58.076642Z","title":"arXiv preprint arXiv:2507.13491 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10167","last_updated":"2026-07-31T12:05:24Z","snapshot_observed_at":"2026-08-05T23:10:46.115458Z","submitted_at":"2026-06-08T20:53:11Z","title":"FlexPath: Adapting Learned Connectivity Guidance to Path Preferences","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T02:14:58.076642Z"},"links":{"cited_paper":"/paper/2507.13491","citing_paper":"/paper/2606.10167"},"observation_digest":"sha256:0d0c69ce015abe9d5e9eeddaec7c21907ccd25b7161b8f30f0621bc817db6e4b","observation_id":"58d072fe-1c40-4f82-8c23-b2706d46233e","resolution":{"observed_at":"2026-08-03T02:14:58.076642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.13491/citation-record","integrity":"/paper/2507.13491/integrity","json":"/paper/2507.13491/citation-record.json","paper":"/paper/2507.13491"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.313392Z","title":"Preference-Based Policy Learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.313392Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:b488103eaa221f479ba2a0b39e232b88f316e8c8528e4063626d42143da255fa","observation_id":"e7c15d3a-7095-4920-9d5d-3d6c1593fed2","resolution":{"observed_at":"2026-08-06T16:28:44.313392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.348210Z","title":"Ames, Samuel Coogan, Magnus Egerstedt, Gennaro Notomista, Koushil Sreenath, and Paulo Tabuada","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.348210Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:78620d6aefa7e17219f900971a2a8cda5e1754b560fbd0d240c6e478c3ff03a7","observation_id":"736f3e60-5c53-4c76-959e-8599b463cd58","resolution":{"observed_at":"2026-08-06T16:28:44.348210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T16:28:44.452672Z","title":"Concrete problems in AI safety, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.452672Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5ed60b14b3de8329a33539c38db54bc3b7df36ee3917c8919687ef53fab62423","observation_id":"f9df93c7-572c-43c2-a873-0318a593964b","resolution":{"observed_at":"2026-08-06T16:28:44.452672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.519797Z","title":"Zico Kolter","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.519797Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d999eccb65426de9cc95a17c0139c697ddc34da26208b38a15bb6b8f02abdc58","observation_id":"efb99a98-d436-42d6-9235-86b8f095e65f","resolution":{"observed_at":"2026-08-06T16:28:44.519797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.620576Z","title":"A Painless Deterministic Policy Gradient Method for Learning-based MPC","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.620576Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:6f5a1129ecbec08e9465d0b449a066f0221b4cd2a03b721765721f9c2dfcb571","observation_id":"279dd837-77d0-419d-9e8a-9a0a0b40d59f","resolution":{"observed_at":"2026-08-06T16:28:44.620576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.695472Z","title":"Andrychowicz et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.695472Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5dfcc37c2c1ab263a1bba006fc5122d7f04ba5991213ff7de99c0b622fb24728","observation_id":"74523618-bc9c-4258-8f83-4476fcbdb7fc","resolution":{"observed_at":"2026-08-06T16:28:44.695472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.789971Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.789971Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2d4e761a4e39347eabc87de7077af12c521fed65b383f9de7bd9eb834a1eb33b","observation_id":"7df2d093-7db2-4c00-aef9-79947ba475b5","resolution":{"observed_at":"2026-08-06T16:28:44.789971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:44.844883Z","title":"MPC-based reinforcement learning for economic problems with application to battery storage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.844883Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:c562291cb3a982dc38eec7de019b541b41249f4620c5f79fad3555ee16c55ca4","observation_id":"c6c96e72-488e-406e-b02b-cbd403035d0b","resolution":{"observed_at":"2026-08-06T16:28:44.844883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T16:28:44.984676Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:44.984676Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:843a88789a674aaaeccd1bd62bbf942618c002df1463d77254e827ab7a4a4d1b","observation_id":"0639dd66-ad08-4362-9d8e-7181577964a9","resolution":{"observed_at":"2026-08-06T16:28:44.984676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13289","last_updated":"2025-03-17T15:38:41Z","snapshot_observed_at":"2026-08-09T13:11:28.906537Z","submitted_at":"2025-03-17T15:38:41Z","title":"Local-Global Learning of Interpretable Control Policies: The Interface between MPC and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2503.13289","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13289","snapshot_observed_at":"2026-08-06T16:29:09.371651Z","title":"Local-Global Learning of Interpretable Control Policies: The Interface between MPC and Reinforcement Learning","venue":"eess.SY","work_id":"8e28f4aa-bd54-4e79-babb-4716775f6293","year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.059769Z"},"links":{"cited_paper":"/paper/2503.13289","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:fa899f60634ed082f0c45d559b3ad696da95061810228bdfc7ba9f3680992fd7","observation_id":"ee64041e-14be-4679-915b-e94e3e37f4e0","resolution":{"observed_at":"2026-08-06T16:29:09.504750Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.136798Z","title":"Gradient-Based Framework for Bilevel Optimization of Black-Box Functions: Synergizing Model-Free Reinforcement Learning and Implicit Function Differentiation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.136798Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:671bcf478a999939e65654e80e3155fb90c412e3b9617d4abc372617397ce478","observation_id":"e10bdf5b-55f9-4429-8028-5a0167c0c045","resolution":{"observed_at":"2026-08-06T16:28:45.136798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.265231Z","title":"Bellemare, Will Dabney, and R´ emi Munos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.265231Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:bebbbe6a08fc96e0a511d0c050a0b18b189ca9f208d9e3cd4fe6b9998b94e909","observation_id":"7e45a85b-b174-41cd-b8ba-18859ed100df","resolution":{"observed_at":"2026-08-06T16:28:45.265231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.332034Z","title":"Bellman and R","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.332034Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:6e7bf7e3b35347212c522d1f4764941854104dc7f1d0ff8cfcee9e684a193782","observation_id":"d3a9b809-f4c7-4026-8e52-51fe473b0f40","resolution":{"observed_at":"2026-08-06T16:28:45.332034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.439282Z","title":null,"venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.439282Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:e39031582fcaf63f0d809c90b7190ae7d89d2fcb8ef5bcb3749cb8f0e572d334","observation_id":"d64caec5-61eb-42b2-a2ca-86a1f1031cb1","resolution":{"observed_at":"2026-08-06T16:28:45.439282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.540272Z","title":"Bellman and Stuart E","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.540272Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:3b312c9b3c7e64dcdb5587765c50e1ca87eb13e4bf7b1799282e69a6d396d22c","observation_id":"7eec9bcf-9dad-4f14-be9f-c1a51c041c06","resolution":{"observed_at":"2026-08-06T16:28:45.540272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.695771Z","title":"Schoellig","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.695771Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:cdf8f8ecc43cf174043acdce359e167fa8b85b190fc2235230a35fb4209928a2","observation_id":"a94bedd2-011e-4ad1-a77d-0967f5ae8ea3","resolution":{"observed_at":"2026-08-06T16:28:45.695771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:45.768307Z","title":"Bertsekas and J.N","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.768307Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:06a72e7353cf962bf036156a69e9eaab20216f807bc4d49049a154f481fd1465","observation_id":"70d7ae2f-36db-4924-acdd-859280358ef8","resolution":{"observed_at":"2026-08-06T16:28:45.768307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01786","last_updated":"2022-06-20T01:01:28Z","snapshot_observed_at":"2026-08-10T06:20:14.281727Z","submitted_at":"2019-06-05T02:12:22Z","title":"Global Optimality Guarantees For Policy Gradient Methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01786","snapshot_observed_at":"2026-08-06T16:28:45.850097Z","title":"Global optimality guarantees for policy gradient methods, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.850097Z"},"links":{"cited_paper":"/paper/1906.01786","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2e0d2e703116cfafaed57573e1c41256681e86786962f037479b9c5843a1b094","observation_id":"e89928d0-be98-41fd-bd19-ef0392e64aaa","resolution":{"observed_at":"2026-08-06T16:28:45.850097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2411.07484","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:29:09.065491Z","title":"Differentiable optimization-based control policy with convergence analysis, 2025","venue":null,"work_id":"8671820e-8e1c-4393-91bf-9867d1cd5b72","year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:45.951592Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f753db244334fcca2d40e41254b06b5e90593338a97d291bc4d122b661619ac4","observation_id":"edd22dfd-71d3-4edb-b8c1-83b28c67ec73","resolution":{"observed_at":"2026-08-06T16:29:09.213959Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.050703Z","title":"A survey on high- dimensional gaussian process modeling with application to Bayesian optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.050703Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7fcf8212dbdd40fb2cd708adf280bb468a80c3b66ebf01692af7f872915e8c36","observation_id":"44f8d265-bd48-4174-907b-d3713d88d0c8","resolution":{"observed_at":"2026-08-06T16:28:46.050703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.156986Z","title":"Blondel and John N","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.156986Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:cca3973b983cdc039699a8479593157d8a93cf488820b4d9f057f226bb80ff7a","observation_id":"102b9f4c-3129-4893-97b9-b00f3e38031e","resolution":{"observed_at":"2026-08-06T16:28:46.156986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.328192Z","title":"Time-varying gaussian process bandit optimization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.328192Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:6cf796be1b859067d62586285bdda66d79677ca45e7deb78618470c0f724d48c","observation_id":"c330312f-fc5c-4212-8054-8f184cb8be85","resolution":{"observed_at":"2026-08-06T16:28:46.328192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.479989Z","title":"Optimization of the model predictive control meta-parameters through reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.479989Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4e65889aa83fbb2db2f089fdac55a78d93b76146f0c11648f881434ebdf28c40","observation_id":"7916b5ca-9698-422b-881a-7bb00e47feb2","resolution":{"observed_at":"2026-08-06T16:28:46.479989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.686707Z","title":"Safe Learning in Robotics: From Learning-Based Control to Safe Reinforcement Learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.686707Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:90a62059bc5a2db9d2ce0d23d06449defb4dd111d511d75c033b5081fb1b38b8","observation_id":"ec0938e2-b854-4aef-bd12-b00dc26d9cd8","resolution":{"observed_at":"2026-08-06T16:28:46.686707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.823255Z","title":"On controller tuning with time-varying bayesian optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.823255Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f953996598fdf2944438ddd8664ebb06acee6b5ceb3527d703b50dd6ad9e8ad2","observation_id":"699c5d58-a22e-4094-9152-2cf237b4d36c","resolution":{"observed_at":"2026-08-06T16:28:46.823255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:46.982388Z","title":"Reinforcement Learning of the Prediction Horizon in Model Predictive Control","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:46.982388Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:47c91dfa2bcaf47a288b8709bb0d19ffaa9c37203e1ef599c04e5838194d7c76","observation_id":"5fac73f7-f300-4eb5-9c54-2955187f2821","resolution":{"observed_at":"2026-08-06T16:28:46.982388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08634","last_updated":"2021-08-05T09:07:47Z","snapshot_observed_at":"2026-07-06T11:19:49.354722Z","submitted_at":"2021-06-16T08:39:51Z","title":"MPC-based Reinforcement Learning for a Simplified Freight Mission of Autonomous Surface Vehicles","version":2},"cited_work":{"arxiv_id":"2106.08634","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.08634","snapshot_observed_at":"2026-08-06T16:29:08.648235Z","title":"MPC-based Reinforcement Learning for a Simplified Freight Mission of Autonomous Surface Vehicles","venue":"eess.SY","work_id":"4b275c76-f973-437d-bce0-4454db11cba7","year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.092643Z"},"links":{"cited_paper":"/paper/2106.08634","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:568a53ad69b0b2546c1fdf2674a93db6406d3883a14aacba3316d85ad34af0a9","observation_id":"887bc6a0-2a96-40e9-96a6-4d7120bcee16","resolution":{"observed_at":"2026-08-06T16:29:08.828872Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.285611Z","title":"Chan, Georgios Makrygiorgos, and Ali Mesbah","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.285611Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:34a8b3ca158d65a83cf83f0f61764c889f591a441628fc36e689d19e1141db22","observation_id":"a305b5f0-1d9e-4f0c-b911-0ed010ca3d25","resolution":{"observed_at":"2026-08-06T16:28:47.285611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.464764Z","title":"Chan, Joel A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.464764Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4a8258ecfb1bfaaf582dfbb4d2a31f685242c796a6777c5f59397d1dbfdb3545","observation_id":"9d9d0d33-fdc7-4195-9439-1c98130e8f3b","resolution":{"observed_at":"2026-08-06T16:28:47.464764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.634740Z","title":"Chan, Joel A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.634740Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:ac902dbcd5665d8d22d6275487d842c4b0256b181d8609b59e6c08410b376b3d","observation_id":"d1d7ee7f-01f0-4376-89fc-33052a11e5c3","resolution":{"observed_at":"2026-08-06T16:28:47.634740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.786612Z","title":"Goal- conditioned reinforcement learning with imagined subgoals","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.786612Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:8eed061836315403a2c22a0392c0b0e44676e41499bfcca14481c40e02fe5033","observation_id":"d457332e-e506-43d3-acf3-fa455d5f8e69","resolution":{"observed_at":"2026-08-06T16:28:47.786612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:47.902314Z","title":"Gnu-RL: A precocial reinforcement learning solution for building hvac control using a differentiable MPC policy","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:47.902314Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:0fa70aca4c853bc5198561680dfd64b6f56927a854bb96162b5efe0348dc8c08","observation_id":"341b75b4-268e-4423-ad7b-b587ad2b3266","resolution":{"observed_at":"2026-08-06T16:28:47.902314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.026251Z","title":"Intrinsically motivated reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.026251Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:766cf64fdc6df86a5da59b58c3f856ed38a1e9d981717b793950de5bbc099e25","observation_id":"15a8427b-cd1e-4084-a8ce-f952fa813103","resolution":{"observed_at":"2026-08-06T16:28:48.026251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.183329Z","title":"Run- indexed time-varying Bayesian optimization with positional encoding for auto-tuning of controllers: Application to a plasma-assisted deposition process with run-to-run drifts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.183329Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2a76a1b045e193c8765cc7a23515db1dfb5b97bc010f4c19049010f65a59d9b8","observation_id":"bd2f87d3-5984-4d34-8c62-8fc395dabd9a","resolution":{"observed_at":"2026-08-06T16:28:48.183329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.303134Z","title":"Choksi and Joel A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.303134Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:95dd0e49c2081a1fbf93f2dfac15e7773700f5d80e6098e29a45bebad96bad9a","observation_id":"0abc7c5a-9e60-4a74-9f52-ac1856ce4cc3","resolution":{"observed_at":"2026-08-06T16:28:48.303134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.442695Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.442695Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7191977db14f3dfc5a471fe278e420a03ec536cbb7c3d372894b3cb60f62233f","observation_id":"0cf21be5-ca6d-415f-a1fa-7091b8de664e","resolution":{"observed_at":"2026-08-06T16:28:48.442695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.547102Z","title":"Model-Based Reinforcement Learning via Meta-Policy Optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.547102Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:3fea20179f4e1100cca27b0fab21ddc970c6796cc99b317a98e181057efe193c","observation_id":"a60f030e-1dfb-4b31-9acd-9b4ec375c21c","resolution":{"observed_at":"2026-08-06T16:28:48.547102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.650902Z","title":null,"venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.650902Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f1747583bae05c3b68460dc37522b945fcc6a6c962a15c58f3424da638863a5f","observation_id":"f9a3e710-ab57-484d-820e-0e6b676855d4","resolution":{"observed_at":"2026-08-06T16:28:48.650902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.783973Z","title":"Bayesian reinforcement learning in continuous POMDPs with gaussian processes","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.783973Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d6430d1969d94d40204952ba11348fbabc8a4d18a290fc7270e9f52c34e2edfb","observation_id":"7a8d9023-da0c-450b-851c-1a65e2b602fa","resolution":{"observed_at":"2026-08-06T16:28:48.783973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.920530Z","title":"Unexpected improvements to expected improvement for Bayesian optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.920530Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d9fa8e2805d276c7461ea7569c8d6932f33fda88dfed2b5de56204f6376badd6","observation_id":"2abae544-0be7-4f26-bd71-66a3cc4029ba","resolution":{"observed_at":"2026-08-06T16:28:48.920530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:48.997747Z","title":"Differentiable Expected Hypervolume Improvement for Parallel Multi-Objective Bayesian Optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:48.997747Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d361c113aeb5b336f932e624e773b327491a874091182191dab9797773bd5a01","observation_id":"c29a358d-7667-4e93-ad4c-d012972837d5","resolution":{"observed_at":"2026-08-06T16:28:48.997747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.142742Z","title":"Multi-objective Bayesian optimization over high-dimensional search spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.142742Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:243c7f7e1a58b02b87ad9ddb9e70efb6dd8f4148775e635f25c53ff7264ca9ef","observation_id":"2c7f02ae-cf66-49e7-80de-7ad56ca92293","resolution":{"observed_at":"2026-08-06T16:28:49.142742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.230348Z","title":"Osborne, and Eytan Bakshy","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.230348Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:960a900d32e931e4613c227eb5db459e6dd9730ef78863a291f709425ad46d8c","observation_id":"e9fc999d-c90b-4519-9d40-38384e5579b4","resolution":{"observed_at":"2026-08-06T16:28:49.230348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.336397Z","title":"Mixed-Variable Bayesian Optimization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.336397Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:a52cdbdae48474bb154cab9247171f965741d4764dc83edf1ae5928ac31725d6","observation_id":"0210de10-1e39-41e0-9adb-1464d20d7cd5","resolution":{"observed_at":"2026-08-06T16:28:49.336397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.483170Z","title":"Gymnasium robotics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.483170Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7933e746f43d408130c01761c67c9414c8374b417170fa62778a29328b53a544","observation_id":"c4d791cb-6b20-44d3-85bf-1894a20a4ff3","resolution":{"observed_at":"2026-08-06T16:28:49.483170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.608731Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.608731Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:c4d3fbace3022ead76e69df286f4b6b7e41a767b0c56240aafe0d540317f32ed","observation_id":"aaa953c0-6213-4f62-bc61-5b55584bdb5f","resolution":{"observed_at":"2026-08-06T16:28:49.608731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:28:49.753278Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.753278Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:16562afae1a4e990402ddc5f6a0a977dbbd25f94917164ba838a792f880a8a9d","observation_id":"5cacf78e-d92e-4915-90aa-72c9e3ddf18c","resolution":{"observed_at":"2026-08-06T16:28:49.753278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.848569Z","title":"Dontchev and R","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.848569Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7a43e90983e02c66548abeeb5300200b7301478fee1e6d0e4fbe296647f1c1ff","observation_id":"e693109d-d6be-4568-a411-8a93d5e9af38","resolution":{"observed_at":"2026-08-06T16:28:49.848569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:49.980220Z","title":"Additive Gaussian Processes","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:49.980220Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:6ad1a3b310869e37f8a1d595a4207ad9d42d18f090df661780a259cb576ceffe","observation_id":"db3c00b8-6091-4279-a1ed-e52b829f7813","resolution":{"observed_at":"2026-08-06T16:28:49.980220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.02244","last_updated":"2020-01-07T19:00:39Z","snapshot_observed_at":"2026-08-05T12:13:09.530705Z","submitted_at":"2020-01-07T19:00:39Z","title":"Infinite-Horizon Differentiable Model Predictive Control","version":1},"cited_work":{"arxiv_id":"2001.02244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.02244","snapshot_observed_at":"2026-08-06T16:29:08.440053Z","title":"Infinite-Horizon Differentiable Model Predictive Control","venue":"math.OC","work_id":"95d63493-9bfd-4767-bec1-0cddab48d096","year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.126635Z"},"links":{"cited_paper":"/paper/2001.02244","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:6ef356c358b1b2284988552b9def677db2450aafd8e26d6d7fdcfea71097326b","observation_id":"d6aaf8e2-8427-4164-8dc6-f5e214697488","resolution":{"observed_at":"2026-08-06T16:29:08.505055Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.200406Z","title":"High-dimensional Bayesian optimization with sparse axis-aligned subspaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.200406Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5eae2906877ec13eef06f20d90f661a814317a53daef20068a835c861c2fbb85","observation_id":"06272063-febb-48c6-81fb-68f7c30fa691","resolution":{"observed_at":"2026-08-06T16:28:50.200406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.286025Z","title":"Scalable global optimization via local Bayesian optimization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.286025Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:613df75ed56a74cbbbeca6d0e7105988c3ed31816e2d45c4a796ffa8d4119541","observation_id":"b2a58269-5ccb-48f9-a0c1-d8760b45e2b1","resolution":{"observed_at":"2026-08-06T16:28:50.286025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.355960Z","title":"Policy Gradient Reinforcement Learning for Uncertain Polytopic LPV Systems based on MHE-MPC","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.355960Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:32d29ef2ab3bb9398a899cbdac408160abb69224814d1d4d831e990a53c78966","observation_id":"9a96bcb0-c537-4c9e-8eb3-bf71e8c28156","resolution":{"observed_at":"2026-08-06T16:28:50.355960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.509504Z","title":"Global convergence of policy gradient methods for the linear quadratic regulator","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.509504Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7208b69f803e77f9e4174e508ad1c929b86b9f428a17404b023801be3f5b1189","observation_id":"7f93373b-1917-41bc-9c87-31d31c96d911","resolution":{"observed_at":"2026-08-06T16:28:50.509504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.622366Z","title":"Dynamic Regret of Policy Optimization in Non- Stationary Environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.622366Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d3663113b14301c7e87b37c0b34eca6a38ba56ed7e77013cc6269d3ba5922ffb","observation_id":"77ebcedc-5837-4f2d-8170-dc463a0941f3","resolution":{"observed_at":"2026-08-06T16:28:50.622366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:50.780885Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.780885Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:987bc2b64bd631c3292b75f3e0b0604c5a99c68c03ff4006500c34de1acb1f52","observation_id":"8b0f7a8c-ec51-4041-8806-b5bb94663ed9","resolution":{"observed_at":"2026-08-06T16:28:50.780885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.02811","last_updated":"2018-07-08T13:06:26Z","snapshot_observed_at":"2026-08-07T12:49:05.688504Z","submitted_at":"2018-07-08T13:06:26Z","title":"A Tutorial on Bayesian Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.02811","snapshot_observed_at":"2026-08-06T16:28:50.893776Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:50.893776Z"},"links":{"cited_paper":"/paper/1807.02811","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:e73eb6e280460c57a3f056de6ee1ea7b72c4ff339f1d7ad66abf4454965516d5","observation_id":"fd8b8bc1-56b0-40bb-8b46-8c1b77b3b521","resolution":{"observed_at":"2026-08-06T16:28:50.893776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.034133Z","title":"Fr¨ ohlich, Melanie N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.034133Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2d376bf1514098b667aaaa2bc16705a4d86601b8fa9ea19866515487c22d014d","observation_id":"773f0b59-9a33-492f-87e0-917ef673b319","resolution":{"observed_at":"2026-08-06T16:28:51.034133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.160277Z","title":"Fr¨ ohlich, Edgar D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.160277Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f631d4afec08d9fec4d7a65c3f3cf6499c5aef07ca75935a76eaeb0d656ddead","observation_id":"00e4ea5d-0466-47aa-84ee-a3aa545643c7","resolution":{"observed_at":"2026-08-06T16:28:51.160277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.312165Z","title":"Learning robust rewards with adversarial inverse reinforcement learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.312165Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:b6f05da3b5bbd1f277db4c93dede27969a85c9f6c425e3315e29024fb1360f83","observation_id":"ff23afdf-4102-4867-b726-540d9165c9c6","resolution":{"observed_at":"2026-08-06T16:28:51.312165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.482326Z","title":"Bayesian Optimization with Inequality Constraints","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.482326Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:561e797352f32ab229e09c15f8bd8f063f23d6515abb67b29fd854e9b37186b7","observation_id":"b831fc45-6678-42d8-8e94-55b9ac6dffd5","resolution":{"observed_at":"2026-08-06T16:28:51.482326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.668203Z","title":"Osborne, and Philipp Hennig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.668203Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:fd40f0f3fbf5d1eec8f116829355169b5ab5a7f37592f80b3cd3a40a95c5a412","observation_id":"c193070c-d987-433f-aa08-cbd41e63d02f","resolution":{"observed_at":"2026-08-06T16:28:51.668203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.761659Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.761659Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:b95e8283fa0e7544d56f1f37f073f75e581e7587f77571014d110bcd296598c8","observation_id":"6f48b991-45db-4c75-862f-f415a93ca696","resolution":{"observed_at":"2026-08-06T16:28:51.761659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:51.901991Z","title":"Identification for control: From the early achievements to the revival of experiment design","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:51.901991Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:cac506972b9ea1402749eed8ba976c0889346d2960628cf5cd8dac47ad1b5fd9","observation_id":"c0a25d99-8986-4e75-bd2a-84f1d70266b4","resolution":{"observed_at":"2026-08-06T16:28:51.901991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.092088Z","title":"Multi-objective optimization of a path-following MPC for vehicle guidance: A Bayesian optimization approach","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.092088Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:1d5096903e9816abbb97ac77aaf7be0b1069b78174963a53431131bb4194cfa3","observation_id":"378c0845-6a81-4a2d-b0be-d0c77d64fd7a","resolution":{"observed_at":"2026-08-06T16:28:52.092088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.188337Z","title":"Lawrence","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.188337Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:8ae86cf156c18d175477944df3c92ab1f952573559cd64269f23d6dd8dcc54bd","observation_id":"a3714ab1-e776-4a58-9962-2c181298f6d7","resolution":{"observed_at":"2026-08-06T16:28:52.188337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.287056Z","title":"Variance Reduction Techniques for Gradient Estimates in Reinforcement Learning","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.287056Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:377366a5b900ce2a46f47cffec0cb93b4fd8be688a5fef693a7ee232e8ffa466","observation_id":"a2018f0b-1014-4e8e-8fb3-56adb8955b9c","resolution":{"observed_at":"2026-08-06T16:28:52.287056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.429909Z","title":"A survey of actor-critic reinforcement learning: Standard and natural policy gradients","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.429909Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:ec7108b9995d37b8e044dc2ee16f31be2eca676631b33a9c7faa239c968c06a5","observation_id":"18675a04-9d78-45a4-867d-9e776506cec3","resolution":{"observed_at":"2026-08-06T16:28:52.429909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.587647Z","title":"Learning for MPC with stability & safety guarantees.Automatica, 146:110598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.587647Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:a304cbcefa4889390cc4a852af786b1d37a59a1640cfda287d153f982e4a1aff","observation_id":"a4aa8710-db08-4f3f-b9b7-30e220691a21","resolution":{"observed_at":"2026-08-06T16:28:52.587647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.681105Z","title":"Safe Reinforcement Learning via Projection on a Safe Set: How to Achieve Optimality? IF AC-PapersOnLine, 53(2):8076– 8081, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.681105Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:05355c7323e59df791d59491e512f075da18a301d6884d834899b2cf741f4154","observation_id":"cfa3db73-79b8-4c35-9657-0102213c6f3f","resolution":{"observed_at":"2026-08-06T16:28:52.681105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.801739Z","title":"Data-Driven Economic NMPC Using Reinforcement Learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.801739Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:87b6ab37b5c632dcc93cf2ed1395913afc379ad5c45574e1ac74ed67233f5976","observation_id":"59cf1326-66f8-46b6-a59b-94dda879d8e5","resolution":{"observed_at":"2026-08-06T16:28:52.801739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:52.917251Z","title":"Reinforcement learning for mixed-integer problems based on MPC","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:52.917251Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:8802d32bce7ad5f495afaae9cd4e380dbfbbb17f3acd4cb9cf2a4d2a38e66e10","observation_id":"42ec66f3-8de9-44d8-9d9f-8b8044d6e82d","resolution":{"observed_at":"2026-08-06T16:28:52.917251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.032903Z","title":"Reinforcement learning based on MPC and the stochastic policy gradient method","venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.032903Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2db16355da01f558c93480a01cea12397e31ca4edf77d447d5e56cde7934a793","observation_id":"4272abc0-ebae-4cb2-b051-432f2bef1fff","resolution":{"observed_at":"2026-08-06T16:28:53.032903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.215348Z","title":"Guerreiro, Carlos M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.215348Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:0c69884c438ac1fdff7b182b1c4f3bc516f20a29798acac27141f26b23edaf0c","observation_id":"1d02cf75-c4a2-4bbf-b276-f7fccaa57a8d","resolution":{"observed_at":"2026-08-06T16:28:53.215348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.364738Z","title":"Evolutionary optimization of high- dimensional multiobjective and many-objective expensive problems assisted by a dropout neural network","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.364738Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2f5c0ebf758bbb53e7f4d68b465b77fd0a0bc322926603f07ee63f9747d78bbf","observation_id":"bf4d0789-a6ac-4db9-9087-4b7688807207","resolution":{"observed_at":"2026-08-06T16:28:53.364738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.451248Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.451248Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:cf205770667be1a6c7a987fae0053199b51091b6a3dcf639ee93167e659df01a","observation_id":"5d57e077-d5c2-48f0-b871-9801f5aabbec","resolution":{"observed_at":"2026-08-06T16:28:53.451248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.616540Z","title":"Mastering diverse control tasks through world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.616540Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:621044b60b808afcde725e44073f63c5f67e32a19db61d27c15996dd9080089c","observation_id":"8f6b6404-08fd-4314-ac2b-a056f07a74a9","resolution":{"observed_at":"2026-08-06T16:28:53.616540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.746417Z","title":"M¨ uller, and Petros Koumoutsakos","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.746417Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:ab04631f859a1a34f69c5bccd3efed9401f7027fff00fe17d1ca7165240e58c4","observation_id":"985e64d1-e6f0-46ea-96ad-c72658422f6a","resolution":{"observed_at":"2026-08-06T16:28:53.746417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:53.896075Z","title":"Hayes et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:53.896075Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:494b928e804c0a8b0f7c8cebcb004f2fa954242546dcb75b647c4319c0c8ae8e","observation_id":"6a93eed2-b3e2-4e98-88fa-2808674b1348","resolution":{"observed_at":"2026-08-06T16:28:53.896075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.067409Z","title":"Deep Gaussian process for multi-objective Bayesian optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.067409Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f9c3afec261156c0f806713f14f074bf8bc66d9d269064879fe7115b08dea457","observation_id":"424688ee-7bfe-4e01-87fd-262b4592691f","resolution":{"observed_at":"2026-08-06T16:28:54.067409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.160670Z","title":"Wabersich, Marcel Menner, and Melanie N","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.160670Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:125fbac0ed982e36ea91639190dbcdd59a975b5d830b528b084063e99202ed20","observation_id":"13cb9411-1ac4-41b8-b7b5-1e2b911a13c2","resolution":{"observed_at":"2026-08-06T16:28:54.160670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.218919Z","title":"Stability-informed Bayesian Optimization for MPC Cost Function Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.218919Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2725da98f797ca36b9c559f9500cca18cb14256d4c987b8b1c79fc2d12ecbe85","observation_id":"a4e564d1-66e1-4475-89a6-404301392b3b","resolution":{"observed_at":"2026-08-06T16:28:54.218919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.267010Z","title":"Multi-objective Bayesian optimisation over sparse subspaces for model predictive control of wind farms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.267010Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f76a5e302e885eb12c00fd9b2c6e883cec62cd173ffe777f16aa908f1965950d","observation_id":"5c7c6898-a4e8-4634-ad24-e03b9aee322f","resolution":{"observed_at":"2026-08-06T16:28:54.267010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.323315Z","title":"Multilayer feedforward networks are universal approximators","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.323315Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d4fa6424ddba57dd36de5dc5e62a94cfad182570fbeeaf03c690cef5273a6a2f","observation_id":"02b17292-dd46-4f76-9494-e62e8d7762b2","resolution":{"observed_at":"2026-08-06T16:28:54.323315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.417150Z","title":"Reinforced Few-Shot Acquisition Function Learning for Bayesian Optimization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.417150Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:66004582a4c8459cc9a013b3b5f5ff47d1186ffeb86b7b113c1f81d69f0e0f85","observation_id":"8b35d3e4-8d5b-418d-9257-caf1f423dee2","resolution":{"observed_at":"2026-08-06T16:28:54.417150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.521695Z","title":"Toward a theoretical foundation of policy optimization for learning control policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.521695Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5950a3725088e8ee965d93c7591844fd837a7a975bc270499a5a168923709fb0","observation_id":"e5df7bd6-1aa3-4c4c-9b3f-a38304e3b418","resolution":{"observed_at":"2026-08-06T16:28:54.521695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21974","last_updated":"2025-05-29T09:07:59Z","snapshot_observed_at":"2026-08-07T13:45:15.899835Z","submitted_at":"2025-05-28T05:00:50Z","title":"BOFormer: Learning to Solve Multi-Objective Bayesian Optimization via Non-Markovian RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21974","snapshot_observed_at":"2026-08-06T16:28:54.642701Z","title":"BOFormer: Learning to solve multi-objective Bayesian optimization via non- markovian rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.642701Z"},"links":{"cited_paper":"/paper/2505.21974","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:804ea2ba332bfe20d151e05ab79a4f94595cf36dd0b20f9d7550e2df351afdac","observation_id":"e69dc31d-ede3-4223-93e5-78dfad687a2a","resolution":{"observed_at":"2026-08-06T16:28:54.642701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.744749Z","title":"Hoos, and Kevin Leyton- Brown","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.744749Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7a8b54cfed37d22b71ff2b447bc0d44beb173b0952eb6bad5e2ac74ee9ca249d","observation_id":"c607f2fd-834d-4132-b10b-08553b2fbb0c","resolution":{"observed_at":"2026-08-06T16:28:54.744749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:54.823943Z","title":"J., Santosh Penubothula, Chandramouli Kamanchi, and Shalabh Bhatnagar","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.823943Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:73e176662f0f3e96429fc78fcc1ab744c44d4c9464b69a2c6a5c574cad56bee4","observation_id":"8409ded2-003a-4d9e-8ef3-5ff90c1ca3a3","resolution":{"observed_at":"2026-08-06T16:28:54.823943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08253","last_updated":"2021-11-29T00:49:49Z","snapshot_observed_at":"2026-08-09T12:18:09.376526Z","submitted_at":"2019-06-19T17:54:53Z","title":"When to Trust Your Model: Model-Based Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08253","snapshot_observed_at":"2026-08-06T16:28:54.925681Z","title":"When to trust your model: Model-based policy optimization, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:54.925681Z"},"links":{"cited_paper":"/paper/1906.08253","citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:4ab33d570b453f31b92d9f7e9adcbafc61a2138d06c0d1fec6fbaa26e1d297cf","observation_id":"52639965-2c9f-4507-b5a9-096583ae1d7b","resolution":{"observed_at":"2026-08-06T16:28:54.925681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.013776Z","title":"Bilevel optimization: Convergence analysis and enhanced design","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.013776Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:d8e96ee59aa6b276a80aa7ac4f49d7c2c9fa7e9adb0182948ce8275feb9696a6","observation_id":"ad30fe06-42b9-4105-89e7-eb02943d00dd","resolution":{"observed_at":"2026-08-06T16:28:55.013776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.092899Z","title":"BINOCULARS for efficient, nonmyopic sequential experimental design","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.092899Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7aa13c0e1987bb5aa9aea5d4b9b1dde90cdce5d35c0c27790e423d4f10ee49c2","observation_id":"65c7e323-be5f-46ed-9849-e3a31a173c21","resolution":{"observed_at":"2026-08-06T16:28:55.092899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.203017Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.203017Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:f4705f311781c0fed91db823b42faa66489913b5d782ef42bf3456a51245c198","observation_id":"a8346639-dbf4-4af7-bd39-1ca183a70804","resolution":{"observed_at":"2026-08-06T16:28:55.203017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.303038Z","title":"Pontryagin Differentiable Programming: An End- to-End Learning and Control Framework","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.303038Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:5461d2a304a9997a01af7907b8b95a115157636e5633ff6255bc054937be712e","observation_id":"d787f3ea-9142-48ca-a59d-9e089b7a6597","resolution":{"observed_at":"2026-08-06T16:28:55.303038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.374609Z","title":"Data-efficient reinforcement learning with probabilistic model predictive control","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.374609Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:1b7a8ce6484cd5116e51046fe84c05a47fcbdbb6be530e29a771d8728c21a3d0","observation_id":"56f647ea-4e48-4fdd-b1df-7239a29065bf","resolution":{"observed_at":"2026-08-06T16:28:55.374609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.476462Z","title":"A review on genetic algorithm: past, present, and future","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.476462Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:606e0f953d28dd71fa3f3ae24f94de8aba24096d3124dd9a72dce21d00d220df","observation_id":"00b79c4c-7343-41b9-94ce-66e91a59bdc3","resolution":{"observed_at":"2026-08-06T16:28:55.476462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.557377Z","title":"Lekkas, and S´ ebastien Gros","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.557377Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:ab094713f41d942f8eacff9aefec893ae266676662299708d1769b74b7b53e03","observation_id":"2c16d47a-591c-4a9f-ae6c-590fd5187d12","resolution":{"observed_at":"2026-08-06T16:28:55.557377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.649869Z","title":"Doyle III","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.649869Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:7e2783cde0d13c22f1c7926dfef8cab489cd2a16ad2a89a3f44abf564dc48356","observation_id":"1c661c43-f00b-45f3-a849-90fe67464ae9","resolution":{"observed_at":"2026-08-06T16:28:55.649869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.743538Z","title":"Huynh, Ali Mesbah, and Joel A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.743538Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:2c4f5278f66f31ab116b1b6b34146afdc40ff0e73db7678321caa536dab2afc5","observation_id":"44ec2c76-757e-4fa2-9cd5-f570cd561f56","resolution":{"observed_at":"2026-08-06T16:28:55.743538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:28:55.851695Z","title":"Lagoudakis and Ronald Parr","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T16:28:55.851695Z"},"links":{"citing_paper":"/paper/2507.13491"},"observation_digest":"sha256:913960cb1e4ddaf6db46355b4075d34d931a908d705256a72c4ef0ab9e4b258b","observation_id":"109af6cc-e0b4-4957-8b30-076b5ab235a9","resolution":{"observed_at":"2026-08-06T16:28:55.851695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13491","last_updated":"2025-07-17T18:59:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T17:58:53.178246Z","submitted_at":"2025-07-17T18:59:54Z","title":"Model-free Reinforcement Learning for Model-based Control: Towards Safe, Interpretable and Sample-efficient Agents"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":96,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":197},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 197 outbound references and 2 inbound Pith citation observations for arXiv:2507.13491."}