{"as_of":"2026-08-10T00:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:328007d18ac3afd02bbe761ee06a7cff273b2d41f975b1740c2e7c1f17378b51","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:33:38.321579Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:22:20.635669Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:18:43.032059Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":"2507.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-07-03T17:18:43.032059Z","title":"Huang, Y ., Jia, Y ., and Zhou, X","venue":null,"work_id":"aaaa680e-b21e-4694-9227-0deb1d653524","year":2025},"citing_paper":{"arxiv_id":"2601.18681","last_updated":"2026-05-08T00:14:56Z","snapshot_observed_at":"2026-07-06T22:43:02.453697Z","submitted_at":"2026-01-26T16:56:40Z","title":"ART for Diffusion Sampling: A Reinforcement Learning Approach to Timestep Schedule","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T10:42:23.768313Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2601.18681"},"observation_digest":"sha256:c40379daa4c3893769425bff6be35ec7e34d506bd091700f1ab56bd4a5227efd","observation_id":"ec665d63-6095-424a-ab99-5b351f53c8d3","resolution":{"observed_at":"2026-05-16T10:42:45.321033Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":"2507.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-07-03T17:18:43.032059Z","title":"Huang, Y ., Jia, Y ., and Zhou, X","venue":null,"work_id":"aaaa680e-b21e-4694-9227-0deb1d653524","year":2025},"citing_paper":{"arxiv_id":"2605.13010","last_updated":"2026-05-13T05:02:47Z","snapshot_observed_at":"2026-08-03T02:37:11.973206Z","submitted_at":"2026-05-13T05:02:47Z","title":"Amortized Guidance for Image Inpainting with Pretrained Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:33:27.641167Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2605.13010"},"observation_digest":"sha256:a602ea8f934b8d2d61827c0c2eb91bb2038bfe0a6fc0cbba8f92dfe654cb12a7","observation_id":"9818ebf3-6f70-41c9-8d27-84dac68bed2a","resolution":{"observed_at":"2026-05-14T19:37:52.603822Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":"2507.00358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-07-03T17:18:43.032059Z","title":"Huang, Y ., Jia, Y ., and Zhou, X","venue":null,"work_id":"aaaa680e-b21e-4694-9227-0deb1d653524","year":2025},"citing_paper":{"arxiv_id":"2607.02137","last_updated":"2026-07-03T02:14:28Z","snapshot_observed_at":"2026-08-08T05:30:20.123996Z","submitted_at":"2026-07-02T13:13:19Z","title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T17:14:04.821073Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2607.02137"},"observation_digest":"sha256:66ee69b5a09a9b77fcac91700d1e35a50442f40b9324504167b372d5bb9b93ad","observation_id":"dd9a3f69-c1e9-47d8-9199-dfe392315231","resolution":{"observed_at":"2026-07-03T17:18:43.033802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-07-12T08:25:48.021715Z","title":"Yilie Huang, Yanwei Jia, and Xunyu Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02137","last_updated":"2026-07-03T02:14:28Z","snapshot_observed_at":"2026-08-08T05:30:20.123996Z","submitted_at":"2026-07-02T13:13:19Z","title":"ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T08:25:48.021715Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2607.02137"},"observation_digest":"sha256:0ce82c5730383b6a3eb859d09e6aeb784190dd311864efb0bb9b57e66d4ac0dc","observation_id":"10076fa3-b771-462d-89e9-b6081230cc75","resolution":{"observed_at":"2026-07-12T08:25:48.021715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00358","snapshot_observed_at":"2026-08-01T11:22:20.635669Z","title":"Data-driven exploration for a class of continuous-time indefinite linear-quadratic reinforcement learning problems.arXiv:2507.00358, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19928","last_updated":"2026-07-22T09:00:00Z","snapshot_observed_at":"2026-08-07T13:13:10.072128Z","submitted_at":"2026-07-22T09:00:00Z","title":"Continuous-Time Reinforcement Learning for $N$-Player Stochastic Differential Games with Exploratory Policies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:22:20.635669Z"},"links":{"cited_paper":"/paper/2507.00358","citing_paper":"/paper/2607.19928"},"observation_digest":"sha256:9a7ae04b51483e77e1d1d3d0fe6439f89759f08b21dcb8033f8bfe414d4ab5cc","observation_id":"2a8504d5-6aa5-4220-9480-8210bd94ac96","resolution":{"observed_at":"2026-08-01T11:22:20.635669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00358/citation-record","integrity":"/paper/2507.00358/integrity","json":"/paper/2507.00358/citation-record.json","paper":"/paper/2507.00358"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.17226","last_updated":"2025-07-24T15:32:35Z","snapshot_observed_at":"2026-08-01T16:37:37.972314Z","submitted_at":"2024-07-24T12:26:21Z","title":"Sublinear Regret for a Class of Continuous-Time Linear-Quadratic Reinforcement Learning Problems","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17226","snapshot_observed_at":"2026-08-06T21:33:32.491006Z","title":"Sublinear regret for a class of continuous-time linear– quadratic reinforcement learning problems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.491006Z"},"links":{"cited_paper":"/paper/2407.17226","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:a64e54d8d6d517591acae09f1f992c2e6869fea27c500b885bf12a008ca386a7","observation_id":"53c011f9-07ed-4843-baeb-28990310a5df","resolution":{"observed_at":"2026-08-06T21:33:32.491006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:50.452651Z","title":null,"venue":null,"work_id":"3eb8be7d-b96f-44f6-b3e0-be98a0829397","year":2007},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.598128Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:a2b9d4f0b34982611f97a10316cfb1e9d03202f26131e1426e071274cba6785e","observation_id":"a416a5af-1070-4a81-87d0-f759c5104c62","resolution":{"observed_at":"2026-08-06T21:33:50.572667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:50.247219Z","title":"Yong and X","venue":null,"work_id":"2f16ad14-82b1-47e1-bf05-036eb8218146","year":1999},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.682350Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:a26adc07caf4fdd6363287a0a144b1cc5c86077f7434d8dbafba71b659701ad9","observation_id":"3319b20d-c984-487a-8f7e-7b9980ff7326","resolution":{"observed_at":"2026-08-06T21:33:50.346689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:49.987126Z","title":"Stochastic linear quadratic regulators with indefinite control weight costs,","venue":null,"work_id":"bc9bcf4d-e7c5-432d-8616-8f67e2c4e88e","year":1998},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.785792Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:fc5327d22071fc8c0a14ccee7ff85cf1c12511c3b8cb339449bdc006b788a0e9","observation_id":"a0260570-6ce0-4368-bfca-79e54bd1e914","resolution":{"observed_at":"2026-08-06T21:33:50.100535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:49.745884Z","title":"Well-posedness and attainability of indefinite stochastic linear quadratic control in infinite time horizon,","venue":null,"work_id":"95c70543-8543-4f23-9523-a128e213ea3f","year":2000},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.875427Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:fa68b81b0b8dcd820874da66ce136c835d552ddd596138d563478cc2a502b679","observation_id":"9a56b895-bbdd-4b7b-9b39-ad595502bcb5","resolution":{"observed_at":"2026-08-06T21:33:49.849387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:49.500679Z","title":"Linear matrix inequalities, riccati equations, and indefinite stochastic linear quadratic controls,","venue":null,"work_id":"02231572-152f-4909-b056-5a67d3f8d046","year":2000},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:32.970981Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:fe437a0f1bbd1dafcc3e4a37853097fa47beaa471520ad5f606d7063f4d19030","observation_id":"56b4a220-ed46-4e8d-bf98-140e0303d25c","resolution":{"observed_at":"2026-08-06T21:33:49.628482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:49.265061Z","title":"Solvability and asymptotic behavior of generalized riccati equations arising in indefinite stochastic lq controls,","venue":null,"work_id":"3cc41afa-e9a5-4dcc-9afd-9b7763c760c7","year":2001},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.097423Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:8d47a8302832f6f5a7b0dc65a26930f030f80abf8a1576570984150ef6f697a8","observation_id":"6a310869-e25f-46c5-b6e2-e8ea4743ab12","resolution":{"observed_at":"2026-08-06T21:33:49.359104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:47.164994Z","title":"A primal-dual semi-definite programming approach to linear quadratic control,","venue":null,"work_id":"223a4799-0429-4da4-b92b-22b94439c368","year":2001},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.187398Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:24525010bbdf1d4767d6930bae9a1538accb514b9d67713801f8a2d1d14df699","observation_id":"5304aed6-de98-4bb2-9c9f-dd2410cfa39f","resolution":{"observed_at":"2026-08-06T21:33:47.792609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:46.803150Z","title":"Stabilization control for itˆ o stochastic system with indefinite state and control weight costs,","venue":null,"work_id":"931067e5-691e-48c9-9d3d-c0e18b26227b","year":2022},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.296546Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:253e507ed6f2bc4f9aae31bb2d5a7403a917895ada3ca60083c16071c5144bfd","observation_id":"c4910c53-0ea6-4635-b660-f8dc3fdc3498","resolution":{"observed_at":"2026-08-06T21:33:47.001170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:46.463860Z","title":"Optimal regulators for a class of nonlinear stochastic systems,","venue":null,"work_id":"ca99f069-3f23-423f-bbe8-869c1cfa028b","year":2023},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.397836Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:79e9518d3460971bd67986363857304b56d6afabceb6670fed8180578a72e0eb","observation_id":"0cc3dcd9-378d-4d3e-a63d-a3fe1fe2e24e","resolution":{"observed_at":"2026-08-06T21:33:46.604066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:46.121153Z","title":"Indefinite linear-quadratic optimal control of mean-field stochas- tic differential equation with jump diffusion: an equivalent cost functional method,","venue":null,"work_id":"c7d8dd7a-4277-4a0f-ab9d-7b2139b2c49a","year":2024},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.501366Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:9d4eaa504499c286f638f2278194efdaf4be82079389c84fbe90293c921cda0f","observation_id":"224c8670-cdc7-48ce-bd8a-0e48d8985ff7","resolution":{"observed_at":"2026-08-06T21:33:46.262692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:45.738292Z","title":"Stochastic linear quadratic optimal control problems with regime- switching jumps in infinite horizon,","venue":null,"work_id":"e1444e65-acea-49f4-90b3-f9de9ba5468a","year":2025},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.595650Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:e499385ea6189cd52685e828ae627c546dfabae7a7f25669df442b5f77153b1f","observation_id":"9ffde277-e768-4d2b-a6fa-a3f77730792b","resolution":{"observed_at":"2026-08-06T21:33:45.935693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:45.456936Z","title":"On estimating the expected return on the market: An exploratory investiga- tion,","venue":null,"work_id":"7f4583c9-c7e8-4934-a430-fce2a0b9883a","year":1980},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.693784Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:5083c69c6e4ce748b1f948e52b2298e9e6ce1a6a0155a5b3f6fd743504fc73f8","observation_id":"c30d62f0-e968-4f7c-925b-97b18f70c6c6","resolution":{"observed_at":"2026-08-06T21:33:45.607054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:45.132753Z","title":null,"venue":null,"work_id":"3e5438a8-ffec-4bb8-9809-01017e4e74dd","year":1998},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.776096Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:21701086f306cad469d99d449b28b604e52b856b11ee1aed18992639e5dafceb","observation_id":"22553b20-340f-4dc7-840b-ee89e39fa168","resolution":{"observed_at":"2026-08-06T21:33:45.269404Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:44.871005Z","title":"Rustem and M","venue":null,"work_id":"7a9a804d-12dd-4b12-a5f2-d41b46b75f8d","year":2009},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.870263Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:fe238b4444f564e186d495026d0961b1293cf80668b965f562b2eb2078dfd1d2","observation_id":"7081615b-f0b1-426c-86b4-783149d67788","resolution":{"observed_at":"2026-08-06T21:33:45.008450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:44.585002Z","title":null,"venue":null,"work_id":"0da80364-002c-43b4-9648-834c8273f859","year":2018},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:33.944653Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:2463e52228f5b03f9704757eb162064ccaf4f5eb23fc76b4cf709b0a45e34439","observation_id":"37632502-7169-4d11-845d-733f8f20b593","resolution":{"observed_at":"2026-08-06T21:33:44.729693Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06976","last_updated":"2019-11-19T14:40:14Z","snapshot_observed_at":"2026-07-06T08:15:23.057129Z","submitted_at":"2019-08-19T16:22:20Z","title":"A survey on intrinsic motivation in reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06976","snapshot_observed_at":"2026-08-06T21:33:34.035769Z","title":"A survey on intrinsic motivation in reinforcement learning,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.035769Z"},"links":{"cited_paper":"/paper/1908.06976","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:4f474cbdc725f580c399340c1c5d3d97c97f48977ab4037251271e2719813ffb","observation_id":"c75ffc6c-70b2-4f62-ae92-8ac9ea4ad5bf","resolution":{"observed_at":"2026-08-06T21:33:34.035769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:44.298464Z","title":"Formal theory of creativity, fun, and intrinsic motivation (1990–2010),","venue":null,"work_id":"b8ce0088-a1b2-4e64-972e-fbc2450a4913","year":1990},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.126427Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:f91acdc47039b0790098a56137a5ebda13993f81f513a9500b02596a1179c4b2","observation_id":"5ec4e6e4-16a0-4143-a74f-b77f89cebd07","resolution":{"observed_at":"2026-08-06T21:33:44.443994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.01732","last_updated":"2017-03-06T05:51:42Z","snapshot_observed_at":"2026-08-09T14:19:09.221373Z","submitted_at":"2017-03-06T05:51:42Z","title":"Surprise-Based Intrinsic Motivation for Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.01732","snapshot_observed_at":"2026-08-06T21:33:34.257469Z","title":"Surprise-based intrinsic motivation for deep reinforcement learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.257469Z"},"links":{"cited_paper":"/paper/1703.01732","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:b3d518da77a5787b1daeff0c3e199ddd9f5aaa17cb544b307140e041ad7790e4","observation_id":"86e125e1-8cb6-47dd-acbd-2a38acffa9ff","resolution":{"observed_at":"2026-08-06T21:33:34.257469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:43.964852Z","title":"Curiosity-driven exploration by self- supervised prediction,","venue":null,"work_id":"663c0761-72f3-45f1-b8f6-7f8046365784","year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.353252Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:dd7201826cf0dc750754ce7ad3eb0e51fd96948b944e84f9cb4d7ba0b228f9f3","observation_id":"347fd813-d80b-41d9-a067-a87eebf867ef","resolution":{"observed_at":"2026-08-06T21:33:44.157257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04355","last_updated":"2018-08-13T17:58:01Z","snapshot_observed_at":"2026-08-02T13:41:53.507553Z","submitted_at":"2018-08-13T17:58:01Z","title":"Large-Scale Study of Curiosity-Driven Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04355","snapshot_observed_at":"2026-08-06T21:33:34.448173Z","title":"Large-scale study of curiosity-driven learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.448173Z"},"links":{"cited_paper":"/paper/1808.04355","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:0852ccceaaa43878e18b84a67d1dd8b53e59fb04d6f2ffde9e14a03f0dcc27c6","observation_id":"84763f26-e404-4299-83e2-4f9271c8ff3d","resolution":{"observed_at":"2026-08-06T21:33:34.448173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-07-06T07:11:32.319931Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-06T21:33:34.568573Z","title":"Exploration by random network distilla- tion,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.568573Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:764eeb95b642f098c91f2d773a98b9dcb35952264cf47b4bf5ba85e31f187a05","observation_id":"10d21d05-a695-4b4e-9f32-1cfd6bd8fa23","resolution":{"observed_at":"2026-08-06T21:33:34.568573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:43.694303Z","title":"Randomized prior functions for deep reinforcement learning,","venue":null,"work_id":"d3df819c-cb12-4cbe-89ba-2d7dafa90e5f","year":2018},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.642461Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:dddd6f7e547e4fb3f2cbfcc8415c942aaeb74e016922d0b18ce6b92555c5a6bd","observation_id":"d9708eae-0a06-4e27-8b0a-39fdd77d889f","resolution":{"observed_at":"2026-08-06T21:33:43.818381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:43.435125Z","title":"Fast active learning for pure exploration in reinforcement learning,","venue":null,"work_id":"30ff41e3-fdec-4412-9fb4-b07372bd8341","year":2021},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.727222Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:8f354c98f2e0871f54bef9692e83d8be16d4c6ba8f61b7a7b400907fe4bc150d","observation_id":"bc9ef8ca-a6c4-49c3-b588-e076d4af1322","resolution":{"observed_at":"2026-08-06T21:33:43.572233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:43.195025Z","title":"# exploration: A study of count-based exploration for deep reinforcement learning,","venue":null,"work_id":"4c3c6730-5e0c-4adc-97e9-546aa948a79a","year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.830998Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:0d821409f1b0a14e1371413346b2b80d3b5d0b1db43ad0d0d027c224e829eda6","observation_id":"e0d6309e-1719-4bf5-a7d2-7193a8dae6a2","resolution":{"observed_at":"2026-08-06T21:33:43.310875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10995","last_updated":"2021-02-26T21:21:11Z","snapshot_observed_at":"2026-07-06T07:30:05.397042Z","submitted_at":"2019-01-30T18:40:37Z","title":"Go-Explore: a New Approach for Hard-Exploration Problems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10995","snapshot_observed_at":"2026-08-06T21:33:34.943251Z","title":"Go-explore: A new approach for hard-exploration problems,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:34.943251Z"},"links":{"cited_paper":"/paper/1901.10995","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:6bff1bc0759700cb119cec8373e2908ebc0b8269380548c84198f32506cbb736","observation_id":"16a5722b-ccca-4208-bb58-b7412a6a7e36","resolution":{"observed_at":"2026-08-06T21:33:34.943251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:42.884907Z","title":"First return, then explore,","venue":null,"work_id":"26fcf69f-0178-4e21-8ffe-04e16b6d42ba","year":2021},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.051690Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:1dbf999f182862cba1df29ffac2e3f171d7ed3165eff6e94be19432bf7916b1d","observation_id":"d28035f0-aadb-4915-83d3-90f2e7e7cc3d","resolution":{"observed_at":"2026-08-06T21:33:43.039615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.08817","last_updated":"2018-10-08T13:38:52Z","snapshot_observed_at":"2026-08-02T04:07:03.272158Z","submitted_at":"2017-07-27T11:16:53Z","title":"Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.08817","snapshot_observed_at":"2026-08-06T21:33:35.132039Z","title":"Leveraging demonstrations for deep reinforcement learning on robotics problems with sparse rewards,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.132039Z"},"links":{"cited_paper":"/paper/1707.08817","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:2468f92a32338fb28122991aacda7b905701f7c44c2ec979b459059b66a03571","observation_id":"b25f14d2-0ef2-4fc4-98fc-5b3db13d6108","resolution":{"observed_at":"2026-08-06T21:33:35.132039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:42.562956Z","title":"A comprehensive survey on safe reinforcement learning,","venue":null,"work_id":"69c8e704-36e2-4510-85f3-2ad2f9f13959","year":2015},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.225247Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:c0cf437de123ed60d351b696f5766b9fbf76d7061054e4b28f5d734b6bdcb492","observation_id":"3f31a89c-dfa3-46ad-a787-31beb912227c","resolution":{"observed_at":"2026-08-06T21:33:42.698606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05173","last_updated":"2017-07-17T14:13:40Z","snapshot_observed_at":"2026-08-03T08:03:37.092983Z","submitted_at":"2017-07-17T14:13:40Z","title":"Trial without Error: Towards Safe Reinforcement Learning via Human Intervention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05173","snapshot_observed_at":"2026-08-06T21:33:35.315253Z","title":"Trial without error: Towards safe reinforcement learning via human intervention,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.315253Z"},"links":{"cited_paper":"/paper/1707.05173","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:1346b73ace45c1cafb4301900bdf5e95e89b1f8ba67ee49942e4bf1c87e7f348","observation_id":"4a86cb93-5458-470a-acfa-5d08381dd836","resolution":{"observed_at":"2026-08-06T21:33:35.315253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:42.372115Z","title":"Policy gradient in continuous time,","venue":null,"work_id":"047eedf6-d1e6-4a0d-96b0-f50c7d9c6b14","year":2006},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.459696Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:cf016d1c3f03056501e390b296269a1e556709b334766d8f38c6b641774e09fd","observation_id":"2e800d42-c001-4948-8579-cb69a9048ba5","resolution":{"observed_at":"2026-08-06T21:33:42.482119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:42.153627Z","title":"Making deep Q-learning methods robust to time dis- cretization,","venue":null,"work_id":"69671a33-6400-4bbc-ad46-85097fe4cc73","year":2019},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.546997Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:39470c4202056cd1c7c9832c2f9fd6358db37313abef90e290dd5ce7c5f544fa","observation_id":"12a82e21-f152-4421-bd38-9659339fcf81","resolution":{"observed_at":"2026-08-06T21:33:42.225469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.948362Z","title":"Time discretization-invariant safe action repetition for policy gradient methods,","venue":null,"work_id":"f9c9f47e-f33e-4fb6-aab8-5b93dcc0e2ce","year":2021},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.719240Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:07378df07926b41ccfe945f873ca0f65f7cdd271e51bfe0237a314c7d6826e81","observation_id":"9bf35128-1d6c-40f9-8dff-3e1a08431cdc","resolution":{"observed_at":"2026-08-06T21:33:42.037479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.788951Z","title":"Optimal scheduling of entropy regularizer for continuous-time linear-quadratic reinforcement learning,","venue":null,"work_id":"bf6b0f70-aa98-456d-890d-8e5b9df5332b","year":2024},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:35.850763Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:c1b24b0e1fe91a85e5fd2c48b8446fa3a824929e6cdbec813a379054044fe8e8","observation_id":"6a3f0064-a959-44be-bc37-060185985191","resolution":{"observed_at":"2026-08-06T21:33:41.858896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.620404Z","title":"Indefinite stochastic riccati equations,","venue":null,"work_id":"2aae6aac-610f-41a1-b612-3b02e19d1338","year":2003},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.049474Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:c7fa8306b495146e8814adabbf2b2efe8332013392ae690af5fc3ddbbcb46882","observation_id":"a8021655-0c66-493c-bb20-04aee29c2885","resolution":{"observed_at":"2026-08-06T21:33:41.714543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.448763Z","title":"Existence of solutions to a class of indefinite stochastic riccati equations,","venue":null,"work_id":"71c578b1-e938-4739-ac67-71be16be4052","year":2013},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.115610Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:c3482744d13b6dab0adf2ff88dc53082ef22b8416af9dc4d8913590958c5a87a","observation_id":"7accc150-d4ad-4931-80bc-e33c5cef8d0a","resolution":{"observed_at":"2026-08-06T21:33:41.550446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.295118Z","title":"Reinforcement learning in continuous time and space: A stochastic control approach,","venue":null,"work_id":"076096af-2fc5-43e4-9cce-d84a38764a02","year":2020},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.290103Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:de0ccb42efb2f71bb2dbfbdf7da34213b126af098a012772794d4807768f2af8","observation_id":"ccc0b981-160e-4ae4-9d31-cb9faf4049c9","resolution":{"observed_at":"2026-08-06T21:33:41.370950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10264","last_updated":"2021-12-19T21:47:04Z","snapshot_observed_at":"2026-08-06T17:21:50.888775Z","submitted_at":"2021-12-19T21:47:04Z","title":"Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10264","snapshot_observed_at":"2026-08-06T21:33:36.415315Z","title":"Exploration-exploitation trade-off for continuous-time episodic reinforcement learning with linear-convex models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.415315Z"},"links":{"cited_paper":"/paper/2112.10264","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:9ffb0e4bf4a09893653be5788d0ee4bcb6781bc2d376e5b44f7317d726bb5608","observation_id":"8f088e2d-74bb-468c-8c19-ee4d41f8cfcc","resolution":{"observed_at":"2026-08-06T21:33:36.415315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:41.128173Z","title":"Policy gradient and actor-critic learning in continuous time and space: Theory and algorithms,","venue":null,"work_id":"87cca34a-ae0a-4174-ab92-2ebb2a7958a4","year":2022},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.559039Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:ac4538377f02786102244d6ba416aa0500545fe0e5a370d4204c295673508f1e","observation_id":"dd631aed-b86c-4aaf-a250-0ecdc1143c55","resolution":{"observed_at":"2026-08-06T21:33:41.177508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.959284Z","title":"Policy evaluation and temporal-difference learning in continuous time and space: A martingale approach,","venue":null,"work_id":"63890e96-2f4f-40d3-97bb-1d042d545912","year":2022},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.759306Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:ab815b6e6957b66aa63a5f064c512af36d6fd4969fedf1562d7a6b950dd65e4b","observation_id":"99628674-cdfd-489c-8807-1efccfe2d68d","resolution":{"observed_at":"2026-08-06T21:33:41.048499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.762159Z","title":"A stochastic approximation method,","venue":null,"work_id":"0bb61205-2bf0-4067-8809-49561912fd49","year":1951},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:36.893967Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:ebfd0492403d066aa591f41896f53b5f6589dad4d9c8402bea8efe15613bb4c1","observation_id":"d2f9f109-02ae-4cbe-a0d1-57cad82d45d9","resolution":{"observed_at":"2026-08-06T21:33:40.850349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.534701Z","title":"Stochastic approximation,","venue":null,"work_id":"03a597b0-54fb-41bc-9631-bcf69622fc9c","year":2003},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.102211Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:f5295963ad2ddb0fec734f877ba99a1e7f50c4d69ce58b16e048127a11fd2bc4","observation_id":"bddc39d1-6174-4d91-ba31-6f58c63fe5d9","resolution":{"observed_at":"2026-08-06T21:33:40.619413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.333108Z","title":null,"venue":null,"work_id":"f8748257-3e78-4df3-a40d-c7cc825a4b31","year":2009},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.259548Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:33a385fceebaa1128322f5257cfdcce8317734eb54a56308e447fa62fa677361","observation_id":"52b5835a-44b2-4069-ac9a-03d5f5a4f485","resolution":{"observed_at":"2026-08-06T21:33:40.425098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:40.059936Z","title":"An overview of stochastic approximation,","venue":null,"work_id":"60985caf-04e0-45c0-ab57-2c8d9498273e","year":2014},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.457228Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:63ae75faf97d99405a447f8c183097cbcf6139e3fa9e3ab094b01c12cbe75a28","observation_id":"ddca0fb6-7710-483a-9b99-e3eade5a629b","resolution":{"observed_at":"2026-08-06T21:33:40.198447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:39.666989Z","title":"A stochastic approximation algorithm with varying bounds,","venue":null,"work_id":"472b25af-f6e7-42e9-8b50-e88dae0a9dea","year":1995},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.676106Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:8674e42d765d640b66a9d0711c5e5cd6bd986d3cb528e9e286457a319bd849eb","observation_id":"ac6aff8d-77e2-43be-a347-3e08a1c4bc21","resolution":{"observed_at":"2026-08-06T21:33:39.861209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:39.392313Z","title":"General bounds and finite-time improvement for the Kiefer-Wolfowitz stochastic approximation algorithm,","venue":null,"work_id":"f5102e24-4942-4f91-8079-b22114e6dbd8","year":2011},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:37.874175Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:f4b38b69e5b7820e6177c1d33018589bacaea254a290e1386a6a88eca002d2f6","observation_id":"a05ae417-2113-4264-88f5-45e8b3888bc7","resolution":{"observed_at":"2026-08-06T21:33:39.528730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:39.040745Z","title":"A convergence theorem for non negative almost supermartin- gales and some applications,","venue":null,"work_id":"d91b1fad-9bf0-4406-95f5-72682489ab8a","year":1971},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:38.010679Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:4e7d882dfd02ba51d6921f12cc3df1fd3dceb3d9a34a55ee4086c5a5508740c0","observation_id":"3d5c3919-a8a0-4fce-80c2-6332c5d319a7","resolution":{"observed_at":"2026-08-06T21:33:39.185660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:33:38.643661Z","title":null,"venue":null,"work_id":"730feb15-6585-4b8e-9d67-b996c22716e8","year":1992},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:38.138033Z"},"links":{"citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:91bf5cabf807e38d063e8049b30f632533fe0434c6ea714a9a9837c3912bfb24","observation_id":"9b5aaec9-6d3e-4734-8818-9053c94d0707","resolution":{"observed_at":"2026-08-06T21:33:38.840537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01302","last_updated":"2024-11-02T16:28:34Z","snapshot_observed_at":"2026-08-09T09:00:42.433938Z","submitted_at":"2024-11-02T16:28:34Z","title":"Regret of exploratory policy improvement and $q$-learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01302","snapshot_observed_at":"2026-08-06T21:33:38.321579Z","title":"Regret of exploratory policy improvement and q-learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:38.321579Z"},"links":{"cited_paper":"/paper/2411.01302","citing_paper":"/paper/2507.00358"},"observation_digest":"sha256:a902bdd953c7f427d639710f1a4e4423ea40082f5b56bfc0e99ff05509e8882c","observation_id":"8fcc4cb7-4208-41ba-83b1-a123ac4ebeb2","resolution":{"observed_at":"2026-08-06T21:33:38.321579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.00358","last_updated":"2025-07-23T14:00:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T09:01:08.945491Z","submitted_at":"2025-07-01T01:09:06Z","title":"Data-Driven Exploration for a Class of Continuous-Time Indefinite Linear--Quadratic Reinforcement Learning Problems"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 5 inbound Pith citation observations for arXiv:2507.00358."}