{"as_of":"2026-08-20T02:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a20e8659230993385b57322f9c715e20489b91688b9f18247db6820b81299818","coverage":[{"denominator":8,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:40:33.633478Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:22:20.627811Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T15:38:34.106512Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":"2512.04697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-07-31T02:03:07.292107Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.Preprint, available at","venue":null,"work_id":"367d1272-f931-439d-a26c-30edc6805e32","year":2025},"citing_paper":{"arxiv_id":"2603.10321","last_updated":"2026-04-04T02:30:23Z","snapshot_observed_at":"2026-07-06T22:48:39.649787Z","submitted_at":"2026-03-11T01:44:34Z","title":"Equilibrium under Time-Inconsistency: A New Existence Theory by Vanishing Entropy Regularization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T14:10:21.557614Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2603.10321"},"observation_digest":"sha256:8bb9fe14e8001b4f6fa92dead15dd58e5913201fefeae5d5208e1148e4858a26","observation_id":"75640507-26e9-4183-a362-14780ded219a","resolution":{"observed_at":"2026-07-31T02:03:07.292107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":"2512.04697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-07-31T02:03:07.292107Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.Preprint, available at","venue":null,"work_id":"367d1272-f931-439d-a26c-30edc6805e32","year":2025},"citing_paper":{"arxiv_id":"2604.27372","last_updated":"2026-04-30T03:37:55Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T03:37:55Z","title":"Continuous-time q-learning for mean-field control with common noise, part-I: Theoretical foundations","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-07T09:19:03.944541Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2604.27372"},"observation_digest":"sha256:fd16f222527bf327d9bfbc960f0b9b1160ec2f91e312a8cc5ea94b02abf11ecc","observation_id":"d5669ebd-2afc-4457-9c87-c6009bffcb29","resolution":{"observed_at":"2026-07-31T02:03:07.292107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":"2512.04697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-07-31T02:03:07.292107Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.Preprint, available at","venue":null,"work_id":"367d1272-f931-439d-a26c-30edc6805e32","year":2025},"citing_paper":{"arxiv_id":"2604.27378","last_updated":"2026-04-30T03:41:00Z","snapshot_observed_at":"2026-08-14T02:13:42.306859Z","submitted_at":"2026-04-30T03:41:00Z","title":"Continuous-time q-learning for mean-field control with common noise, part-II: q-learning algorithms","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-07T08:41:31.247249Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2604.27378"},"observation_digest":"sha256:9f7d3cd12271501794c8df1d06bfb27b7ff9ddbfea707866498a8b5b7eeddfc4","observation_id":"4117b598-bf81-4f0b-96b1-8232ddb200c1","resolution":{"observed_at":"2026-07-31T02:03:07.292107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":"2512.04697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-07-31T02:03:07.292107Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.Preprint, available at","venue":null,"work_id":"367d1272-f931-439d-a26c-30edc6805e32","year":2025},"citing_paper":{"arxiv_id":"2605.14363","last_updated":"2026-05-28T11:39:54Z","snapshot_observed_at":"2026-08-14T20:46:35.252081Z","submitted_at":"2026-05-14T04:45:34Z","title":"Equilibrium for Time-inconsistent Mean Field Games: A Systematic Analysis by Entropy Regularization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T02:13:18.861160Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2605.14363"},"observation_digest":"sha256:bef046e120d2539b08bba344571c415ced8c94f147412dd7eb5706c1cff1a376","observation_id":"bedc34ca-490f-45de-8ad9-9a62f5a67d3f","resolution":{"observed_at":"2026-07-31T02:03:07.292107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":"2512.04697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-07-31T02:03:07.292107Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.Preprint, available at","venue":null,"work_id":"367d1272-f931-439d-a26c-30edc6805e32","year":2025},"citing_paper":{"arxiv_id":"2605.29892","last_updated":"2026-05-28T13:16:22Z","snapshot_observed_at":"2026-07-06T23:39:15.620929Z","submitted_at":"2026-05-28T13:16:22Z","title":"Mean Field Competition of Optimal Switching: The Vanishing Entropy Regularization Approach","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T05:53:55.444421Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2605.29892"},"observation_digest":"sha256:e67a86757712112271615b1e7690d6f9e4bb7d840a07d7a3f4b53cae972630a8","observation_id":"ebe6d189-a512-47f1-9bed-0c2b2bdb1baa","resolution":{"observed_at":"2026-07-31T02:03:07.292107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":"2512.04697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-07-31T02:03:07.292107Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.Preprint, available at","venue":null,"work_id":"367d1272-f931-439d-a26c-30edc6805e32","year":2025},"citing_paper":{"arxiv_id":"2606.11798","last_updated":"2026-06-10T08:31:54Z","snapshot_observed_at":"2026-08-16T21:34:33.792621Z","submitted_at":"2026-06-10T08:31:54Z","title":"Deterministic Policy Gradient for Learning Equilibrium in Time-Inconsistent Control Problems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T07:56:11.143952Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2606.11798"},"observation_digest":"sha256:99e3f9f77445956340cc17af17a3a4a5bd13c1d8608ee7e0bb524b9fce240725","observation_id":"bf738f60-25ae-434c-afb2-64351c2421dc","resolution":{"observed_at":"2026-07-31T02:03:07.292107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":"2512.04697","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-07-31T02:03:07.292107Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.Preprint, available at","venue":null,"work_id":"367d1272-f931-439d-a26c-30edc6805e32","year":2025},"citing_paper":{"arxiv_id":"2606.12875","last_updated":"2026-06-11T04:02:25Z","snapshot_observed_at":"2026-08-18T11:34:00.732219Z","submitted_at":"2026-06-11T04:02:25Z","title":"Randomized Optimal Switching Problem and Related Mirror Descent Flow","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:23:23.030846Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2606.12875"},"observation_digest":"sha256:73744f9d671b3b5f61f1ff2c24beaab93d7500e07c131ff37e0604b757e62fe2","observation_id":"e11fb221-d557-46cc-bf3c-81a7570cf5f0","resolution":{"observed_at":"2026-07-31T02:03:07.292107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04697","snapshot_observed_at":"2026-08-01T11:22:20.627811Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes.arXiv:2512.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-15T14:56:51.010591Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.627811Z"},"links":{"cited_paper":"/paper/2512.04697","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:eecf7b9a35c583353850765bbd44ad76b7e9dd7201353835f12bd7de032d1e47","observation_id":"e4888772-7b01-4209-aa7b-cd21a5fdc2f2","resolution":{"observed_at":"2026-08-01T11:22:20.627811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.04697/citation-record","integrity":"/paper/2512.04697/integrity","json":"/paper/2512.04697/citation-record.json","paper":"/paper/2512.04697"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2026-08-08T18:23:46Z","snapshot_observed_at":"2026-08-14T07:10:44.480404Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-03T18:40:33.523529Z","title":"Tang and X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:33.523529Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:68e66e14956121b79cd013da055a85c207170355bf8442d155e4f447e1a44130","observation_id":"aa758c4c-9bfa-4c24-a10a-f3f9ce6b2f26","resolution":{"observed_at":"2026-08-03T18:40:33.523529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04521","last_updated":"2026-07-31T08:57:04Z","snapshot_observed_at":"2026-08-16T13:36:47.455609Z","submitted_at":"2024-07-05T14:06:59Z","title":"Unified continuous-time q-learning for mean-field game and mean-field control problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04521","snapshot_observed_at":"2026-08-03T18:40:33.633478Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:33.633478Z"},"links":{"cited_paper":"/paper/2407.04521","citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:6a4853baaa2f431da5b793eec4ea8161ed65f1880946f9dd0f0eab6592c3a316","observation_id":"bc47abb3-348a-4f1d-a86b-46ddfa7d5c89","resolution":{"observed_at":"2026-08-03T18:40:33.633478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22203","last_updated":"2026-05-13T03:14:11Z","snapshot_observed_at":"2026-07-06T21:48:40.344916Z","submitted_at":"2025-06-27T13:16:31Z","title":"A Reinforcement Learning Framework for Some Singular Stochastic Control Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22203","snapshot_observed_at":"2026-08-03T18:40:33.417501Z","title":"Liang, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":1965,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:33.417501Z"},"links":{"cited_paper":"/paper/2506.22203","citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:999e635a30db101476a8e71944f296716942ac31d3ee0251bdf48587ced9c49c","observation_id":"8ef18a3b-e27c-4f3d-b03b-240f8d4e3257","resolution":{"observed_at":"2026-08-03T18:40:33.417501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.12018","last_updated":"2026-05-23T20:13:21Z","snapshot_observed_at":"2026-08-15T02:20:45.271394Z","submitted_at":"2025-09-15T14:58:03Z","title":"A Two-fold Randomization Framework for Impulse Control Problems","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.12018","snapshot_observed_at":"2026-08-03T18:40:32.937455Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:32.937455Z"},"links":{"cited_paper":"/paper/2509.12018","citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:ec79d4614c61463091d66ca16b15324776e74434b36a4c3601c2bf6e816a54c3","observation_id":"6d62ca23-1a6c-4053-9ccc-fde9eb011d72","resolution":{"observed_at":"2026-08-03T18:40:32.937455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09242","last_updated":"2025-08-11T06:22:52Z","snapshot_observed_at":"2026-08-19T01:45:57.891148Z","submitted_at":"2024-08-17T16:27:19Z","title":"Learning to Optimally Stop Diffusion Processes, with Financial Applications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09242","snapshot_observed_at":"2026-08-03T18:40:33.058915Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:33.058915Z"},"links":{"cited_paper":"/paper/2408.09242","citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:550c54058978ec69e915773aae7a3b81c080fae389a94ba62aa43daad5d0596c","observation_id":"b810dae3-1fcb-4582-ba65-5826100d48ea","resolution":{"observed_at":"2026-08-03T18:40:33.058915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:40:32.817487Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:32.817487Z"},"links":{"citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:f2ff5c71e4edb4840026df71d951ef8feeaaed4ea63ebd8f1224cb830439d80d","observation_id":"1e4c2a5f-5c00-4222-ac2e-b336fc67cad9","resolution":{"observed_at":"2026-08-03T18:40:32.817487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16449","last_updated":"2025-08-25T01:12:32Z","snapshot_observed_at":"2026-08-16T13:49:22.565635Z","submitted_at":"2024-05-26T06:33:11Z","title":"Reinforcement Learning for Jump-Diffusions, with Financial Applications","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16449","snapshot_observed_at":"2026-08-03T18:40:33.333118Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:33.333118Z"},"links":{"cited_paper":"/paper/2405.16449","citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:63e3b799c6c9c1a7390aefcfa96330de9703cc990ac96c0df4f6df8aeb09dbd3","observation_id":"f534aa72-264b-4a02-a0f2-5a8175cb9bda","resolution":{"observed_at":"2026-08-03T18:40:33.333118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:40:33.193079Z","title":"Dianetti, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T18:40:33.193079Z"},"links":{"citing_paper":"/paper/2512.04697"},"observation_digest":"sha256:b0cbd88d385c0fbcd5e17046c89eccaabbc15ffa521dd23edddc943f7cdaa4a4","observation_id":"935cf58c-9e9a-4751-a580-10f6e0482858","resolution":{"observed_at":"2026-08-03T18:40:33.193079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.04697","last_updated":"2026-07-30T02:52:31Z","latest_version":3,"primary_category":"math.OC","snapshot_observed_at":"2026-08-14T20:45:38.139305Z","submitted_at":"2025-12-04T11:48:07Z","title":"Continuous-time reinforcement learning for optimal switching over multiple regimes"},"reference_resolution":{"displayed":8,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":8},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 8 of 8 outbound references and 8 inbound Pith citation observations for arXiv:2512.04697."}