{"as_of":"2026-08-10T19:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2df18194c190605ed9307b5afbb17356235dc7f46e91be2da8a0deac82c103de","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T11:59:18.223000Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.21925/citation-record","integrity":"/paper/2606.21925/integrity","json":"/paper/2606.21925/citation-record.json","paper":"/paper/2606.21925"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.12535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:09:53.352765Z","title":"PhiBE: A PDE-based Bellman equation for continuous time policy evaluation","venue":null,"work_id":"ec7f9ff1-d42c-4e7b-a44c-335e01e2ab99","year":2024},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:72ba707cd790fe2fb4beb6ae01b0d6792681ea9d7882a4a88fc02f435d821b4e","observation_id":"18eff5ca-7a2d-4808-834e-35318cf2d6cb","resolution":{"observed_at":"2026-07-04T08:19:43.735582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02267","last_updated":"2025-09-02T12:43:46Z","snapshot_observed_at":"2026-08-09T08:54:18.387770Z","submitted_at":"2025-09-02T12:43:46Z","title":"A deep learning-driven iterative scheme for high-dimensional HJB equations in portfolio selection with exogenous and endogenous costs","version":1},"cited_work":{"arxiv_id":"2509.02267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.02267","snapshot_observed_at":"2026-07-04T08:19:43.723658Z","title":"arXiv preprint arXiv:2509.02267 , year=","venue":null,"work_id":"a6c9673c-b8e0-4105-9d45-8d0a6e001110","year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"cited_paper":"/paper/2509.02267","citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:113982d4b2c87c23074322852223bb802992785c75a434c21cf193bc9919154b","observation_id":"04c12d0c-ce18-4373-bfe1-5e6fa0c88265","resolution":{"observed_at":"2026-07-04T08:19:43.725204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"IEEE Transactions on Systems, Man, and Cybernetics, Part B (Cybernetics) , volume=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:0e8471f4e3085470784500e27e0d88b4eb4592a9020e2793462c799f5b9cd4f0","observation_id":"934246e1-cb9d-45eb-84a2-3eee0650766b","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:e0a43cf8144edad43bf0b10b7c324f9d843ad74b06317db30fd58c2a9b9a6997","observation_id":"19e74262-7d46-4d61-9f3b-3f924dd8b227","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:d2d568f854caa224658b0639bf44a1edb9e93b0d798087d327818b449eb17aa3","observation_id":"20cdcf70-8ac3-493a-9c1c-b0e2849869f6","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:bffd428d56ea60b5c652abc281f3e5b045b77048f62181b264f5ab64739a7909","observation_id":"4ab243e7-2d46-42bf-8a0d-d1c89d485692","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:7949ea97d1a4460ea366f9bfe84a5da6ee8a111da784c01b26deba39efd37488","observation_id":"c1224526-dfcb-4d76-9ee3-2a8d49eec90c","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:19eaa10cb7a27e363fcf9fd5e143e9f2de3c465b46698931989243d0d64633f2","observation_id":"8fbe1b95-bc16-432d-8202-4af28da38db8","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"nature , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:c1d4094d00f34301706034571b846dea9cc21e7672d51bd1391344c7b5a760c4","observation_id":"89c20810-68b5-41fa-9374-78d75d8fdd3b","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"nature , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:1ff91e456e32b23ac482c1cc8670df84577c5cda4ec7e30fb1efe80039df8b20","observation_id":"b8778096-3981-4ca8-acda-f4cfc621209d","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Nature , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:650cc59b38c8d964554c15c0fb0786d59b1c7b04519e7d9d502b886b41bc0f67","observation_id":"0bd96a63-0a59-4b12-a9b6-d48096270142","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Proceedings of Thirty Third Conference on Learning Theory , pages =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:fea696e5e5ab2cfd097f76c9d8e181e5a2ab93566084eadc0332dfdb3a7c5488","observation_id":"4550f723-c310-4007-93d9-8312435f2de7","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Learning for Dynamics and Control , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:5aad7ff7c94e52fe788604d59107303fed7914bf959c9109570ee59528ef647c","observation_id":"750b08af-8a36-4a6a-bc19-a502a0cbc4cb","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"2012 , publisher=","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:46078386120212786b61be564f36a8289790d0e2108f5ddd11dda5c52a3537f8","observation_id":"2ab6bb7f-f4bf-43df-9290-3949d92dd0ce","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05966","last_updated":"2024-07-08T14:05:03Z","snapshot_observed_at":"2026-08-10T05:46:08.314210Z","submitted_at":"2024-07-08T14:05:03Z","title":"On Bellman equations for continuous-time policy evaluation I: discretization and approximation","version":1},"cited_work":{"arxiv_id":"2407.05966","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.05966","snapshot_observed_at":"2026-07-04T14:09:53.364779Z","title":"On Bellman equations for continuous-time policy eval- uation i: discretization and approximation","venue":null,"work_id":"03ece040-6ce2-4e6f-9c8e-36ed9db9739a","year":2024},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"cited_paper":"/paper/2407.05966","citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:86af7852cb208d3aff548ea19294987f4fa5a42532c60f0cb9969576b289f83c","observation_id":"0c6a27e9-382c-4505-b43a-f8eebf07a442","resolution":{"observed_at":"2026-07-04T08:19:43.722513Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:2d6816c2cead273a1694398f8776a3f5f1f3c269a91df9c654f29f496598b7d5","observation_id":"d9afcbe3-f083-4e61-88ed-de3303f542c4","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:2df11bb4ebbfa34b19991bd8a64650dd1bb0e8f08fdb034b7fdd5c59209f9036","observation_id":"c6008699-7e41-4acf-bf61-0341000a0432","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Proceedings of the 33rd International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:54179ddafbf0a724f469544ec9a87dd6e4800f31387b60830140ec8947f1b47a","observation_id":"c0d74310-c4de-4f6e-ad4d-c97510bf9d10","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:a5b7be93f91e0ea99e1131f1b1268a12c23431b891e82ba8c3fd2edfb3df4ec0","observation_id":"8ac63e5b-ca1e-4f7b-b4fa-71d0ef671faa","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:182fafc48d08a85aed7e69c607705c289fb082621ad89534097d78e861ef2cb1","observation_id":"15ddb8c4-cefe-4f94-ae70-e530de688b26","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:6b0d9cb2b9b2257a0aa90688031ab5596986d5126b2c2dc251b28c35c274edf9","observation_id":"19621f60-3ccd-415a-9074-9ebf79af2bcb","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:03a3215bc49d673c4b44402f7f64939b90c496812f11aa49ea98f97b88c19509","observation_id":"053fdde9-d793-47c2-a1db-ebc9126bc6d9","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"nature , volume=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:df2049894825b665ed8849c11be65aaa62f44a8b1904448a22ee0dbb84eefaba","observation_id":"bf1cc9bd-5d35-44ba-897b-676e9579f6ca","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":"1909.08593","doi":"10.48550/arxiv.1909.08593","metadata_source":"pith","pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Language Models from Human Preferences","venue":"cs.CL","work_id":"4f54aad1-f3b6-404f-b9c7-e21ba0a33b99","year":2019},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:28020217e9bc8c91ebfecc4357c1b1174341b5aa5115ccdabd07d392d3e02995","observation_id":"367d7271-099a-4518-a20c-05bb9a19bd78","resolution":{"observed_at":"2026-07-04T08:19:43.727713Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:07.78032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:07.78032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Journal of Biomedical Informatics , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:8f8677a4d035a6bcb2a43236e5dea7de28899f1c069e701598562e0ac8acc64c","observation_id":"bb19c0c9-32fd-4e67-a652-f445688e1a6f","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"IEEE reviews in biomedical engineering , volume=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:f6633620aba6e3205a45b6317fa8eaa4628bc32736426fa80855a6f06b336aef","observation_id":"855c7827-76bd-4b66-893d-37df84b4e8cd","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:8381a42591f0d835a67415e7e151339c8f8c60a76ec00dc81106f7db7f51edd2","observation_id":"3e36efa1-0d45-482c-bc05-fcd60a7accd4","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Diabetes care , volume=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:6cdf706102fc4b7a07248d1abaa6674ac9121799181fc5817432ed81c3fa78e5","observation_id":"f44cb654-dfaf-4dc3-bdfe-6ab863782256","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"2009 , PAGES =","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:b6236c7b863bbb5a2c0150fdc112106f0c46714b3c4e6360f59c7175c11fe516","observation_id":"49ebfd26-0602-4599-9382-2cdb3e85c80b","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"1999 , PAGES =","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:cb5edd00d620a93089a08d249d03b5d1a72208c23876409623a9e0ac3eb8935c","observation_id":"0be9f6bc-7a30-4fbc-a4e1-1f40b10b3435","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"2013 , publisher=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:55ebb6ea75430f90130b0f421a4f6046ef67535311e1b02eff01e75f3cf5a7bc","observation_id":"cf9aff3e-d1e9-4aeb-9f94-ef391324fb40","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"2018 , publisher=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:edb05d01f71c21f736a387b9f70560dbec9b1e3d471329e9b1df33c629e5aa53","observation_id":"08f09fbe-dbf9-4e3e-b8af-ef43f1c8c0b1","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Communications of the ACM , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:f44ca7d7fb89cca80c4981937e65a7425f095381c5d3ecc66b5105db6dee60f2","observation_id":"12b26388-1008-47df-86e6-f8ecf738da50","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Machine learning , volume=","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:9416e07c072f11082bc82d0c9751eed0dda7568fcf72ca4fe7647d820bf668d6","observation_id":"0b4a959f-98c3-4204-97ad-8d9828ae82f2","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Neural computation , volume=","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:cc897c2ba5afb70eba60fd959bb6e96d8ca3a59b955678ce29f406234bad395b","observation_id":"a3f58064-b45e-46ec-bc6b-7ec294a0024e","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:8e9ddb23e246812f329652acdf1c0698f8714cf939d4304315514942f9660975","observation_id":"994c117e-a4a6-447b-8c56-40322671a9e5","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Mathematical Finance , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:93bee4902deddcb0609db2de12566f8c441ee47afeb98ab65bf227a8627cb969","observation_id":"8d865529-02cb-459e-bcad-e98ac21a55cf","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:f543f6675b0a2889cc105db4167ea041b24dba10b70c3b0ff524e1858477c0a0","observation_id":"9f8b2071-5aaf-4f28-b923-af70ebaf0bdb","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:a761816493a7704e4c7e31f10644373f1a99cae7eb61d0247a702af83c8f542a","observation_id":"05eef019-2554-42e5-8703-382cf5b13121","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10264","last_updated":"2021-12-19T21:47:04Z","snapshot_observed_at":"2026-08-06T17:21:50.888775Z","submitted_at":"2021-12-19T21:47:04Z","title":"Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models","version":1},"cited_work":{"arxiv_id":"2112.10264","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.10264","snapshot_observed_at":"2026-07-04T08:19:43.712345Z","title":"arXiv preprint arXiv:2112.10264 , year=","venue":null,"work_id":"a1b17737-7c2c-4eae-a2a3-7965213cf023","year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"cited_paper":"/paper/2112.10264","citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:ad5873b8c113d3c7c0518e49564ae4fc9cd3a3969e10441d97f18012c4e0b70a","observation_id":"67ff858d-e86e-46ef-bdcb-9c6803eaefde","resolution":{"observed_at":"2026-07-04T08:19:43.714245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Proceedings of 1994 IEEE International Conference on Neural Networks (ICNN'94) , volume=","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:ec03fb8ccb5971ba29a99a08b1e8671f54389abd6b6498a457f7c8eb5dd59e41","observation_id":"71230e14-7b31-4992-ae3b-8da3e7268cb6","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:efe7cdcafcaafb22d0a206063151374fc288cd1444f5c5d6f1325346086acb55","observation_id":"06b65086-d6d3-4a33-a329-49e9f4da9ce0","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.11797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:19:43.739663Z","title":"arXiv preprint arXiv:2312.11797 , year=","venue":null,"work_id":"ba24d661-7519-4a00-872d-bc697daaa399","year":2023},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:cb5bceaaaff33847fdf56898d558544a8a2d5eb4e4d56053f98a07d259488462","observation_id":"38dd8a99-14f8-4979-af37-682c35b998f5","resolution":{"observed_at":"2026-07-04T08:19:43.741211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:09:53.359840Z","title":"Accuracy of discretely sampled stochastic policies in continuous-time reinforcement learning","venue":null,"work_id":"d13d6263-cc59-4b9f-b60c-07157c1a048e","year":2025},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:b3915a4935ab841b7a5c7cb051e30d5726cdff4ea1f76d68c6adee2a2214dfb5","observation_id":"e6df4a6b-d4e8-4945-9440-a0f53987d181","resolution":{"observed_at":"2026-07-04T08:19:43.711049Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"SIAM Journal on Control and Optimization , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:07a7306bee84e6059c031a5c5bfcc3d094bf903a7eed7e41ea9e0c74fe06ce68","observation_id":"a6779442-fbec-4060-a4f5-4003830d89e2","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14821","last_updated":"2025-05-20T18:37:51Z","snapshot_observed_at":"2026-08-09T08:47:20.404554Z","submitted_at":"2025-05-20T18:37:51Z","title":"Sample and Computationally Efficient Continuous-Time Reinforcement Learning with General Function Approximation","version":1},"cited_work":{"arxiv_id":"2505.14821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14821","snapshot_observed_at":"2026-07-04T08:19:43.736761Z","title":"arXiv preprint arXiv:2505.14821 , year=","venue":null,"work_id":"786272b1-6b96-4281-8295-d1d12af14ba5","year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"cited_paper":"/paper/2505.14821","citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:d9ef12ff3afbb0633371eb7aa10a7d9325f81ae9df98d14ffe4b4e3821b5311c","observation_id":"cbb84136-02e0-4a41-85f4-0d7c5d34707a","resolution":{"observed_at":"2026-07-04T08:19:43.738291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.15910","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:19:43.715522Z","title":"arXiv preprint arXiv:2501.15910 , year=","venue":null,"work_id":"c54e395a-97a0-42c3-bd38-2b2d213d7731","year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:de75a5cafc85a03aa246c33c437735e73abda06bf174a528397d33331aa66513","observation_id":"bd6d39ca-0319-4470-b8c2-21cfa1cac476","resolution":{"observed_at":"2026-07-04T08:19:43.717166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Journal of Scientific Computing , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:25f49e5656ad039f8a823d8ca6287077d6d8ecf7156c0bea0a3dc6ed4ee667d0","observation_id":"03482a95-84e2-4a18-ae21-16ed0955cb42","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"siam REVIEW , volume=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:aeb27820cbb186100ed2bc1564e4bd2d05e386ec4074e27e1b57e9b1ae1ba26f","observation_id":"cb9bcc7d-18bf-4e12-a4ee-ebdfe57e34d7","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:95150aab3677e0e254d603e59f785c3dfa7cd432a5f18ce9ff8a6b116cfb2a61","observation_id":"530f72c9-89f1-40ed-bbda-ffbeb9089ca3","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:60454f20908b5ad3b3a1e8f8d6b007602329a668a779373e9e269c20acb5d4bd","observation_id":"e27d9c20-043e-4bae-b7d5-fa6858c9b9cc","resolution":{"observed_at":"2026-07-04T08:19:43.732770Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:1bfb75004f0b3f3c31196e2da42f6ced8af09f1a319a187df069e8d3f43e989c","observation_id":"cd053fce-c077-4e74-b0cd-f5cb5fec808d","resolution":{"observed_at":"2026-07-04T08:19:43.719766Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:8261cae9ce59294d3d4da9afa6225d6314581003a9e228ee3a10303c97fad521","observation_id":"c385a958-195c-47d4-ab89-c77c0ea35295","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"International Journal of Control , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:f782b91c07437bd103f8fc9d8950ff1ca8054e4741e1dd1886b6b8aac2f0f2af","observation_id":"9f7d6dff-f7bf-42f0-84a6-5afefbb7daa2","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Automatica , volume=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:84d7571a232b9205ad6404c81fd02ee2f04f32e2ad33d6e3bfcf19e558b6f83a","observation_id":"dfe4782a-75b7-41fa-9ad9-429e017ec662","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"and Soner, H","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:265dc010706548465783c3635e1d084da19b407b4edd361405a44d86bce69256","observation_id":"5a906685-70ed-4412-9a02-7adfaef95846","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:587a8c950c28fdc690eb754e6fa583b17926922372e2d61e496af5986ef5c027","observation_id":"dfd43f8e-7d29-409b-a7cc-eb86dd3fd42e","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.05208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:19:43.728830Z","title":"Optimal-PhiBE: A PDE-based Model-free framework for Continuous-time Reinforcement Learning","venue":null,"work_id":"dd7f0b2c-b6df-4fd8-9f52-635864989651","year":2025},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:f27da2ff8bee6d1ec2adc58118e15df335877f38c4a06c4c40359f8174d3fae2","observation_id":"b18012b3-f462-4aed-8cd3-ef1127ebfc9e","resolution":{"observed_at":"2026-07-04T08:19:43.730286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Foundations and Trends","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:bcc65607822b6685c540df41f781592b59fe22cdb4fe4019c93bd140f69d0448","observation_id":"279677a0-3c9e-4781-aa95-284ab8c065cd","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"The Thirty Sixth Annual Conference on Learning Theory , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:7571e651f524255a951addb09579a31508f952128e1350b218e50bb267cbc09b","observation_id":"990d68b9-c7ee-4c6d-9d52-9ec1dcc31224","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"1998 , publisher=","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:6c46085fa5ebae53c94f514e087cd81de15b3858812f2fda659c3ea517332623","observation_id":"d5ad3f98-74fc-4d20-86c6-6614bfe0eb44","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"Proceedings of The Web Conference 2020 , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:afe8c34333b9309a443828bec98cc0f99360e75674da2be21ca5e4feb4cfb5cb","observation_id":"8c8c50dd-4ccb-4b62-90e5-f08ee8e9ca14","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"2013 , publisher=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:9cdc48753f19e441532a67f28493248b434d03b93bf6dc049a2baa1cb7c4cbf1","observation_id":"92bee1c0-48ed-4617-b883-8a4cfed91be3","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"2006 , publisher=","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:82da578dc19213bb18d1be93a8fe119a9a3a5fe5212afd755893078d3daa7235","observation_id":"feb815fa-22da-4f6f-b8db-a1a88838bbc2","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T11:59:18.223000Z","title":"2003 , publisher=","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-26T11:59:18.223000Z"},"links":{"citing_paper":"/paper/2606.21925"},"observation_digest":"sha256:2b21a6bf53bebc8cc90179becce1ce652d0700ae66861db066f45ef09d721083","observation_id":"884ddb00-8c2a-446c-aabf-7dd0336dbc9e","resolution":{"observed_at":"2026-06-26T11:59:18.223000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.21925","last_updated":"2026-06-20T07:47:41Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T07:47:41Z","title":"PhiBE-Q-Learning: Bridging Off-Policy Reinforcement Learning and Continuous-Time Control"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":53,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2606.21925."}