{"as_of":"2026-08-23T15:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:521f2987ead2ece5c308041304bb7be278c8043b7b17f237650b74021fa17d8e","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T04:23:38.033851Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:09:17.938445Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03168","snapshot_observed_at":"2026-08-01T16:09:17.938445Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18128","last_updated":"2026-07-20T16:20:55Z","snapshot_observed_at":"2026-08-17T10:44:28.429717Z","submitted_at":"2026-07-20T16:20:55Z","title":"Feedback Cycles in Exploratory Equilibria","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T16:09:17.938445Z"},"links":{"cited_paper":"/paper/2607.03168","citing_paper":"/paper/2607.18128"},"observation_digest":"sha256:e9d9c3ef2dbca055c9e4f71fd86b14d48bcc50b385db43bbd522452bcd740094","observation_id":"405b5c91-abeb-4dd3-abfe-59b019854367","resolution":{"observed_at":"2026-08-01T16:09:17.938445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.03168/citation-record","integrity":"/paper/2607.03168/integrity","json":"/paper/2607.03168/citation-record.json","paper":"/paper/2607.03168"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"The reality gap in robotics: Challenges, solutions, and best practices.Annual Review of Control, Robotics, and Autonomous Systems, 9:403–432, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:785c34d2676e46925ebbbfbf78fe175fa0b64379969ec3bf3a22efca7e14f330","observation_id":"e55c09b6-214b-41c4-8fe4-70267e612289","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"State entropy regularization for robust reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:b9e2d8b2813e10056c9df45d57d8b286342a5a18f380362c8e400e0a19be2e88","observation_id":"68954cfc-3963-4741-ac1e-d62685f871fd","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Algorithmic market making in dealer markets with hedging and market impact.Mathematical Finance, 33(1):41–79, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:c344699cf0c575d28684f925a7a441b6ac3b88506c8d48d92e1510aee7448ee7","observation_id":"f1c3656a-ec19-47df-9b4e-17bd9f8e0751","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous-time q-learning in jump-diffusion models under Tsallis entropy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:5dcc037bd54ee13f05f8fff59127449cadb903338cdfbe75bda31522b99f613f","observation_id":"17b60314-984c-4c47-bc44-1d1f51d93bfb","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:64321303bfb7398187c6278301c89e052f632e36cec9c9c524c8cd43777875fe","observation_id":"a0143cd1-6702-447f-be60-aa3e46cec213","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robust multi-agent reinforcement learning via adversarial regularization: Theoretical foundation and stable algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:47b4cadd13c3c07dc1ebaa440c80a1e24f8e8b1d3ee1f92239874e10c45c661f","observation_id":"3eab32c3-4cf9-4e07-91eb-901d772f0714","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Cambridge University Press, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:8e29cf321248da03b57ed9ea926d5bfded0322058dce993c13bcd009967619a1","observation_id":"375f2e5c-5cde-46f8-8bf4-f4f2579de619","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robust reinforcement learning with general utility","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:aac7660dc56f339f12366a55c0078ae99842af2daba169eb1caf027801afe723","observation_id":"93fc19e1-55bd-4ff7-9bbb-f105249d01e2","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Deterministic policy gradient for reinforcement learning with continuous time and state, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:fc2576a4369239e59237be81cf4e64760631f1b7662b6a7f6ab124c21300996b","observation_id":"05a45eaf-66a8-46bc-94b4-32e5fdc5d141","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Dai and Mark Gluzman","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:a0a3bb6ef52068a09fec2d8793760cf3388d0367ecdc3f3dbaa9e04a60611f9a","observation_id":"9871788a-9966-433f-8100-16b1431a853b","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Twice regularized MDPs and the equivalence between robustness and regularization.Advances in Neural Information Processing Systems, 34:22274–22287, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:fcd4a037422a9472a2382235665f5a022cc9f5db42e3b9e2a1439032db74f016","observation_id":"4d8373fd-bd9b-41b5-bd38-c14404bc1707","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robustness and regularization in rein- forcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:f2e5dfe4db46c5917761da9e97d7a2ff21efc26449b4e41ff73a39d8bf954fbd","observation_id":"d8a486ce-ae07-45a6-a9cb-ded5fdad91b4","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Entropy regularization in mean-field games of optimal stopping.arXiv preprint arXiv:2509.18821, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:0b47901d7d3bb1df8a791e03db8305983a72ef6dca6a0f008c46fb6d81d8aa67","observation_id":"c9963f6f-df42-4436-ad16-87b200406be7","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Donsker and S","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:84546417e7c5f6facc1ea6550a163d4c54ee4c77eb3c4368b026fac321ba0592","observation_id":"06821e48-926d-47d9-860f-99bbed3b73f5","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Maximum entropy RL (provably) solves some robust RL problems","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:ced646e0aa055facac83edfbf922cbcd30042cfc6afffd004298b6a4e1c75625","observation_id":"8d1741b6-4870-48e5-9b7e-1f4392276592","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Actor-critic learning for mean-field control in continuous time.Journal of Machine Learning Research, 26(127):1–42, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:05845d4e26c76bc4f49350be6b5ee87d5f92248c7bd8cfa9965ce61d65f28cf5","observation_id":"ceaf1e3a-95e4-4c89-974f-6252c0a4ef51","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Reinforcement learning for jump-diffusions, with financial applications.Mathematical Finance, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:f59885b491e8055418d86f9b7f6731da03814444dc8eb8a71611d69e0899e923","observation_id":"5f952601-a583-4640-a2f9-84ea97d7c283","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"A theory of regularized Markov decision processes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:499312cc62c49ef7a85a7410134acf796803580099932bc231de779d2e6985e5","observation_id":"bfe9bb42-3b36-421d-9306-73fe6d92c58b","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Convergence of policy gradient methods for finite-horizon exploratory linear-quadratic control problems.SIAM Journal on Control and Optimization, 62(2):1060–1092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:35dc434b131472cf9d3db3e092b7dd1b2654fe3a325adf8c9acdffc0234b3dbf","observation_id":"cf25a4cd-9b13-4596-a1f4-195d8fcf92ed","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Scalable first-order methods for robust MDPs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:931ebf5f49a4940a962e88c50c9545a83233d0dfa80592a98fe84cb9eb82452c","observation_id":"a4b43664-96f5-4105-8dd6-d488cb367ba9","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous-time Markov decision processes","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:e2b1f63011db5616b9a233fea978f1573c2079778c593d2d039a0ff29d211461","observation_id":"1da14839-0990-42c5-9ff4-278c954c8b20","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Entropy regularization for mean field games with learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:2b853cd8e6d233ae9f2d079c2035ae533aa0032f93d051fbf9f6e266b0925c8f","observation_id":"519eeef1-1c2a-4b6b-9844-2cc1cc5686a0","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Soft actor-critic algorithms and applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:2f29e9a5928228369babc170b0626dd519dec3c773174ccb53a9964935ea305e","observation_id":"75dda10d-d98a-4867-95cf-11c7bde5c433","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:975ecb70260ad86d2a7b2822afbaca8c92d2c60abd6b06aaa6e4cc492cb651b7","observation_id":"d16ae5b1-2ed3-41e6-b042-0eec7db811c6","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Regularized policies are reward robust","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:1989966cf23f4507376e00a0cb566d8f0141ab1dd49c4dc75ff3cdafc9535905","observation_id":"b554bdba-10d9-4f60-a934-1bc179a4210a","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:48ffaa63aee100580fb3ed6baa7efc398d3a5e0eea7b8b8818f5b01c3b015a53","observation_id":"00812bbf-3931-488c-88f9-76d4fa584d30","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous-time risk-sensitive reinforcement learning via quadratic variation penalty.Applied Mathematics & Optimization, 93(2):58, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:99f2092cc3ea69310252d3f985e328ee71917cad9e7c735ecafd6774d09930a2","observation_id":"57de4f8b-0432-421c-999d-106d8dbee4ff","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Accuracy of discretely sampled stochastic policies in continuous-time reinforcement learning.arXiv preprint arXiv:2503.09981, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:ac36b905a8773234a3dff79ec7800457688af9259f0242954f593a95ed3d89e8","observation_id":"50dd245c-0439-4ef6-9f6f-cf85d969695f","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Policy evaluation and temporal-difference learning in continuous time and space: A martingale approach.Journal of Machine Learning Research, 23(154):1–55, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:19929e973133ab32d41f3f283c39211ad94df2be40b902754ae1f72f7cd5d5dd","observation_id":"ca5b8012-018c-481a-9a3b-339c03f57ff6","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Policy gradient and actor-critic learning in continuous time and space: Theory and algorithms.Journal of Machine Learning Research, 23(275):1–50, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:b6018a7c3a29bcf139af1bcb0d3c808642597100bfc0cb364312fb96b3b86615","observation_id":"1383df64-a354-442d-a83d-f65a237b477c","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"q-learning in continuous time.Journal of Machine Learning Research, 24(161):1–61, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:ed6a87e9329c9a1af8e4f19e2e03dfc0a5b1689e01c7416561b8e48fddb5e0b7","observation_id":"5f99d273-aa42-46c5-8082-2bc62f6cc01e","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"A Fisher–Rao gradient flow for entropy-regularised Markov decision processes in Polish spaces.Foundations of Computational Mathematics, pages 1–75, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:f7b613f92fc9b6e50b7696698401b1033a3e1113062586c5e2dcb854df26dcad","observation_id":"80902972-6b15-4076-b3b6-7d024cfb8136","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Policy gradient for rectangular robust Markov decision processes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:d607ea61ce53df696143145d3fba21812aaba0980db9cc68404a2d361266bd55","observation_id":"13b458a5-c8bd-4e28-80ed-eeab45b891e9","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Policy mirror descent for reinforcement learning: Linear convergence, new sampling complexity, and generalized problem classes.Mathematical Programming, 198:1059–1106, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:94b1dd015f5f3258a227fbff2ce3b6f37808e847714309264b4579ce777a8b7d","observation_id":"c4496fd1-8fc2-473a-b071-6806cdbaefc3","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Policy gradient algorithms for robust MDPs with nonrectan- gular uncertainty sets.SIAM Journal on Optimization, 36(1):120–151, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:3906a04da0e277b3d5ab77e168b83457cb47d795290e579bde5cded3c5c67edd","observation_id":"7096bc84-ddec-424f-9abc-0d800e7fcb34","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Efficient adversarial training without attacking: Worst-case-aware robust reinforcement learning.Advances in Neural Information Processing Systems, 35:22547–22561, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:c97cd67452f453f1ae4c0c4d4d91c04b059c4ff6b2f7dc70702e961c326e1b42","observation_id":"4a7b2e0a-e9a1-4cff-b1e9-1568af924771","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Reinforcement learning in robust Markov decision processes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:95ad593a7cc8edd1d4a6cca7c5fcbe38fb24726c00287d29f0980b9b4f53fb09","observation_id":"ad55dd71-92bb-4076-b9eb-75a7d95e6428","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robust value iteration for continuous control tasks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:409ee3cb571be6292355119657a1b605c2618b2eb27eb5cfa11c3b974451d9a7","observation_id":"d38b7c30-186c-4d52-a905-450a7b0c1fb0","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05358","last_updated":"2026-04-12T00:40:35Z","snapshot_observed_at":"2026-08-18T16:16:06.524949Z","submitted_at":"2024-06-08T05:27:01Z","title":"Reinforcement Learning for Intensity Control: An Application to Choice-Based Network Revenue Management","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05358","snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Reinforcement learning for intensity control: An application to choice-based network revenue management.arXiv preprint arXiv:2406.05358, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"cited_paper":"/paper/2406.05358","citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:34d2a63d02c7133e37af66762e720ce776bd0a113bb58749e0d063293ed051ea","observation_id":"d236428f-cfe0-44a9-b0a2-40acbdaa2310","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robust reinforcement learning.Neural Computation, 17(2):335–359, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:aa8e9fff2da936a9553cef5efd9110072aef07416744cb396262edb3a88d00f5","observation_id":"7737300e-14dd-4916-bd0e-727fb99ea930","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robust control of Markov decision processes with uncertain transition matrices.Operations Research, 53(5):780–798, 2005","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:6ea48fb4f8fbafd889fc69b9fcb556fb8bba5c6bb6c7bcb56a1aa3f6a6a6f303","observation_id":"8226e0d7-d891-4fda-8b47-8f9f08183c15","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Springer, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:e45cb54a8258e06551e0be815aa51416c40600e98c63674dd0bece8e779215eb","observation_id":"f10580b3-e943-4592-826e-82eefe4a3812","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Variational inference for Markov jump processes.Advances in Neural Information Processing Systems, 20, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:d5bf2c4fee3c1c5cf8f025c6aade79fde9d9c2b1d0fad6bdb70f57e039774c38","observation_id":"7388648a-f0fb-42fd-af3a-6f87f7e49b11","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robustness and risk-sensitivity in Markov decision processes","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:35efbadc4493aa550623a96111ce410e2a12f5caf147fb0a75b3437d3c7dce6d","observation_id":"6f16f85a-0f9f-440c-9ef8-c57b66dbab0d","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Sim-to-real transfer of robotic control with dynamics randomization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:801d2eb1fe6c6d56e99e370a0e05c7f17a8937e4ee229033635db8b6ee871cbb","observation_id":"f456ba5f-84f4-41ef-b56e-26ff18d895ce","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous-time reinforcement learning for robust control under worst-case uncertainty.International Journal of Systems Science, 52(4):770–784, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:4b02fe6e4b08a7ad22bc8cc0e44e00b0f82535dd77dd3c60c91fbc0ac96408bd","observation_id":"7eec0f32-c0b8-43bf-b4d2-8e51b7386498","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robust adversarial reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:1b0d3baf66bfb3e2d95881340c688a1acbb01608bb3d755ee6b0b3e6c3ca5e52","observation_id":"8e7c112a-2c92-46c5-ab72-5ac3a559ed11","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Puterman.Markov Decision Processes: Discrete Stochastic Dynamic Programming","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:b253cd1216399080d9881e80e5bd4c4fb5965f61c79850cd24e1e2316b489e64","observation_id":"5eadbd4f-9e6c-4827-89e2-5307305ad9a2","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"On stochastic optimal control and reinforcement learning by approximate inference","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:939ab1b4a8ff57e6da4fa943f844d492ed27a87e631c5730cfd55cbe8fca32b0","observation_id":"e0975acb-b648-469c-a14a-e6a5950eedec","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Regularity and stability of feedback relaxed controls.SIAM Journal on Control and Optimization, 59(5):3118–3151, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:4fdde17968a0ffd787f5415d54ba7316e0b83e6a2c558a1f04715468c24a65e8","observation_id":"91091be2-8e07-4505-85ca-f86e04e5149f","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous-time q-learning for mean-field control with common noise, part-I: Theoretical foundations, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:762870bb4303a5f795be2670d81058c7d1cd187fe8b3b06d4b61ff80757f868e","observation_id":"1554f660-0ae9-4110-b35d-4769b455d15a","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous-time q-learning for mean-field control with common noise, part-II: q-learning algorithms, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:72b95fbaf6789fac1f3ce63a13979d1fe59a8c59e5ad4ee4c22844558bc1fdc6","observation_id":"b6bd3e5a-2bac-44b6-8db4-13d0b3411562","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:6bdf4749372f2ccb95123fbb1d6704cde6f329347e7d54b7ebcee5f68f828406","observation_id":"ee18c052-cba1-4ad1-ae4f-6403bc1833d6","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:69c74edf0134a2d92a6160cb6bd3e21fc28d36c74af86aedf5ea3300795d26bc","observation_id":"fb3ea989-c6e9-4ced-88c6-f75f2888c12a","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Optimal scheduling of entropy regularizer for continuous-time linear-quadratic reinforcement learning.SIAM Journal on Control and Optimization, 62(1):135–166, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:6dfeb0eb1ceb4cf29acde92b4898005e250ea84c7fb8e03b1e1f67102dd80a68","observation_id":"dc0f0bab-6d5d-492a-8808-74f992b82ec0","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Action robust reinforcement learning and applications in continuous control","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:e819f1491de3514f9d0b298ec4c7cc132c5b4ceb05db1fd85bc56147c8c33e88","observation_id":"319dfdc7-b431-419e-a0d0-16d2c806af49","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Domain randomization for transferring deep neural networks from simulation to the real world","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:8de9b29eb826d0209f8db55916ea11867495f64df8238ce90c8e583dd5d96652","observation_id":"2a4d9645-cfe6-4b7b-ac61-0c52c551fa53","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Linearly-solvable Markov decision problems","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:ff462bf90a53d369bce1b48451b6977b9babbd94f33326e7b8beb919791070cf","observation_id":"07434df1-89cb-4df0-a59e-143d55f9c475","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Policy gradient in robust MDPs with global convergence guarantee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:5c80df6c0a1068a2cb97a0021404d72db148c0144115a22248ad006ea7b3c4a6","observation_id":"728b9346-1ba6-458b-929c-e14820ffab7e","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous time q-learning for mean-field control problems.Applied Mathematics & Optimization, 91(1):10, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:cae358ce6b6e3b2ee72fe771f04336ab1c63f02194214c3e0903b4be58558a7b","observation_id":"f47cd47e-76b9-4c6c-9834-2e89455c1353","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Robust Markov decision processes.Mathematics of Operations Research, 38(1):153–183, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:25eed2c9bcb9ed26678fcf97289e6d4e7016573a5ca1ca6937e1c636780bd5e1","observation_id":"f8a690eb-adaf-4ca4-9737-ea0cfcbac422","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Continuous-time q-learning for Markov regime switching system under Tsallis entropy, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:dd079ec41bcd8a97d08b01b034523ef7cff756fb70a1f3cd4e22e361ae01d916","observation_id":"98aeb53b-fa58-4097-b5d6-79ff899e23cf","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"Policy optimization for continuous reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:3f2ff45ccdf4bd1dccaa7449aaf82e921f5740a21234a9c483d12818c526c213","observation_id":"4d4dd054-e8ce-470a-a732-a683a06c4fce","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"X s∈S ¯dπ ρ(s) X a∈As µ(a|s) exp R(s, a)−R ˜θ∗(s, a) τ # =τlog","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:41a043d6c5ad11047b1510e26812afc1ea6dfdff824762cf6f95b2442124c384","observation_id":"ad1d66e8-f82a-4178-9e1f-1954cfefa391","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"The test statistic is t= WC(πτ)−WC(π std)q SE2 τ + SE2 0 , where SEτ and SE0 are the standard errors (across seeds) at the respective worst-case grid cells","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:cfd31ee1d85be3d4a4f329e7522886f69e2e145c1805fb069a255a9720c91324","observation_id":"2d47622e-dd70-4fdd-be56-2bc61b8f3730","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"In both market making and queueing, performance peaks at an intermediate∆t and degrades for both coarser and finer grids","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:b705f096378adbd7c8d55049b32511a9fd64810051f0b29db95f05967b27e2da","observation_id":"f8c45d80-4a8d-4ca2-9227-6a7782a8cc60","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":"The arrival-driven implementation has no grid resolution hyperparameter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:d4d9baf4a12057b6bc6e6b91eab46cfbdb0b91e266bd719027f5f09305087255","observation_id":"33d1054c-1eed-4d66-b8cf-0d8aa0590d72","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T04:23:38.033851Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T04:23:38.033851Z"},"links":{"citing_paper":"/paper/2607.03168"},"observation_digest":"sha256:dcd5bc3f92187dbb3d660ce9642ab05a88952a8f15c2d2df14c966186aaea6b2","observation_id":"87c9c915-756e-4036-a7b0-9f18f168bf5d","resolution":{"observed_at":"2026-07-12T04:23:38.033851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03168","last_updated":"2026-07-03T10:09:39Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-08-18T19:39:02.904900Z","submitted_at":"2026-07-03T10:09:39Z","title":"Entropy Regularization Improves Policy Robustness in Continuous-Time Reinforcement Learning"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 1 inbound Pith citation observation for arXiv:2607.03168."}