{"as_of":"2026-08-10T11:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24cb5b451c6d556e95f557609687f84dc0e66de6529fabf1f2752a8380bb7279","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T04:15:32.156380Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T07:42:38.840826Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20718","snapshot_observed_at":"2026-07-14T07:42:38.840826Z","title":"Bayraktar, M","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11005","last_updated":"2026-07-13T02:10:07Z","snapshot_observed_at":"2026-08-09T07:49:21.814844Z","submitted_at":"2026-07-13T02:10:07Z","title":"Actor-Critic Learning for Extended Mean Field Control with Deterministic Policies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T07:42:38.840826Z"},"links":{"cited_paper":"/paper/2605.20718","citing_paper":"/paper/2607.11005"},"observation_digest":"sha256:fdd250dd753109372b741d1388a6644099e64eb24b4a5c45cea1bb928fc6a00f","observation_id":"4ad6043e-c0ec-4375-9534-e26bdd39c1c0","resolution":{"observed_at":"2026-07-14T07:42:38.840826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.20718/citation-record","integrity":"/paper/2605.20718/integrity","json":"/paper/2605.20718/citation-record.json","paper":"/paper/2605.20718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean field type control with congestion.Applied Mathematics & Optimization, 73(3):393–418","venue":null,"work_id":"84986d80-f8a0-42dc-b153-423f0843152a","year":2016},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:90cbe7a69899785b28742b8c7fcceaeb9ebcf5986f278e5f77d0384edaf181f8","observation_id":"05de4c07-224a-4306-8b9a-8bf16bf4161c","resolution":{"observed_at":"2026-05-21T10:04:59.490060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean field type control with congestion II: An augmented lagrangian method","venue":null,"work_id":"6ed898df-6c20-4a19-8a58-849a725636be","year":2016},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:21ba062fce86127654c530dc3aed7a785c481d968c5e7536c195da5a819159c7","observation_id":"3dd960af-38e9-4a6d-aaf1-1032088a9090","resolution":{"observed_at":"2026-05-21T10:04:59.517720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A maximum principle for SDEs of mean-field type.Applied Mathematics and Optimization, 63(3):341–356","venue":null,"work_id":"4e38e950-7965-455f-a219-a4452c372785","year":2011},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:5ec83c190783f296710fad8507c489c37571302e73ffb6ff872e485e86b3d552","observation_id":"6fa60bf4-8ce6-44a1-a761-ee849b12035e","resolution":{"observed_at":"2026-05-21T10:04:59.499691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7e794e5a-9edd-4859-82e6-41e62954a1b7","year":2020},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:006f430ee96d6527a379e4b3082cbcfd10296796415f403eaecefbc997ae5155","observation_id":"ef6e21f7-309a-4258-be77-d44777e1c7d4","resolution":{"observed_at":"2026-05-21T10:04:59.497337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"83eae273-5cdb-465e-ac96-94cc2746a4ec","year":1994},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:bf311f2885fa2c9fa79dfc1f55bfe8e16fd3bc2a3899a8e6dcb51edee9c89cb8","observation_id":"5d337347-a7c9-4a61-ab40-a7df3afb61e2","resolution":{"observed_at":"2026-05-21T10:04:59.506991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A weak martingale approach to linear-quadratic McKean–Vlasov stochastic control problems.Journal of Optimization Theory and Applications, 181(2):347–382","venue":null,"work_id":"d7cab478-473a-4127-a00e-0b0fe819d0fb","year":2019},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:8b2cfc67e4f9c5aca69dd292be7d1c54c02fe12994374bc6f6e7722cbe59dabe","observation_id":"cde67c11-0658-408a-8749-49c08e5e5535","resolution":{"observed_at":"2026-05-21T10:04:59.510647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Viscosity solutions of fully second-order hjb equations in the wasserstein space.SIAM Journal on Control and Optimization","venue":null,"work_id":"7449c41b-6200-4bc5-afc2-fc3c3548a00a","year":2026},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:1de468128fda8019cac3e22d2b09f0fadfa7a543aacdf32dfe90d7b6b182b5f2","observation_id":"ec294a9e-112a-4809-a0db-58f70fa30209","resolution":{"observed_at":"2026-05-21T10:04:59.515366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"260f87a6-969c-4b3c-8d6b-98077d62bbf7","year":2018},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:5d9f461da147da16b4e0cff907e6ad7365ef7e5d70657851fe68b090beb1feb9","observation_id":"e692bfda-9e9b-44a6-beee-57e0867ade51","resolution":{"observed_at":"2026-05-21T10:04:59.478246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Comparison for semi-continuous viscosity solutions for second order pdes on the wasserstein space.Journal of Differential Equations, 455:1–31","venue":null,"work_id":"8bc4f3e6-25d8-4382-bdc9-7963a8de7db6","year":2026},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:480efe2fe475336ee4a9ae5ce05e64daa762b6b54c3749d7dbc098a75baa4086","observation_id":"df652d8d-1a42-4a1a-813f-aaa5787aefe4","resolution":{"observed_at":"2026-05-21T10:04:59.394800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Comparison of viscosity solutions for a class of second-order pdes on the wasserstein space.Communications in Partial Differential Equations, 50(4):570–613","venue":null,"work_id":"03950694-b20c-4faa-996d-ce59ee0a20bb","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:6929540041c004e151fee8b06d2310b13bfe1da83e94228f680f5bde3de109d8","observation_id":"b4866fb1-ecc5-4341-9b5a-1471cad57481","resolution":{"observed_at":"2026-05-21T10:04:59.378667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convergence rate of particle system for second-order pdes on wasserstein space.SIAM Journal on Control and Optimization, 63(3):1515–1782","venue":null,"work_id":"7d4e3a95-1ad9-4983-9238-4a202860e636","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:2e1aa144a644ff1495123e71dbc747d808ed492d7027352ed155ecc6ac3d1413","observation_id":"d168fa9b-0f8d-4a70-840a-3b6981181431","resolution":{"observed_at":"2026-05-21T10:04:59.520327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean-field phibe: Continuous-time mean-field reinforcement learning from discrete-time data.Preprint","venue":null,"work_id":"ec634f5e-b9a0-4622-bcc4-e330ad6e1385","year":2026},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:c55557d89a8590b643ebe5eafee9d95254dc0f3dd46d2a1c7bad9904f698a187","observation_id":"4dec7e8d-8736-4516-aa37-1f5df937b1ee","resolution":{"observed_at":"2026-05-21T10:04:59.392078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ergodicity and turnpike properties of linear-quadratic mean field control problems","venue":null,"work_id":"f76f9519-62aa-47d7-8010-beb90a0043b2","year":2024},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:abb1e6e9413e690bd2956473b5548e18af3f14146cddad53bac102eb362c1d6a","observation_id":"bcad8097-7337-4ea7-b363-fbe4ad755c8e","resolution":{"observed_at":"2026-05-21T10:04:59.399715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convergence and turnpike properties of linear-quadratic mean field control problems with common noise.arXiv preprint arXiv","venue":null,"work_id":"b1a641c9-54b7-4c8e-96d6-a80438525341","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:1751af45023d38de166b6578cb12c8974c1fdc27f222648bf6bb02ab9f75212e","observation_id":"225173af-5163-41b6-b458-e17f4b74a673","resolution":{"observed_at":"2026-05-21T10:04:59.470720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning with linear function approximations in mean-field control.Journal of Machine Learning Research, 26(192):1–53","venue":null,"work_id":"abafa878-6e14-4b82-938d-e5cd43b4c862","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:d4389ab8babdc1546d16e022424e399d808d3b6bab71fc399025a3d2b5588e76","observation_id":"39ab7bfb-4943-4faf-a496-2c4a4d101bc8","resolution":{"observed_at":"2026-05-21T10:04:59.527805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Propagation of chaos of forward-backward stochastic differential equa- tions with graphon interactions.Applied Mathematics and Optimization, 88(1):Article 25","venue":null,"work_id":"fcf3d683-11ed-463f-850a-8748148f6c79","year":2023},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:709c79ad5f9786d140038ed4279f6d79e0d9f0ff1d5257d34714ebefc02363b7","observation_id":"d7f1b6b7-27fb-4d45-a2ca-6e6e7c752ad2","resolution":{"observed_at":"2026-05-21T10:04:59.539194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpringerBriefs in Mathematics","venue":null,"work_id":"615035c9-a56d-47b5-bd3c-e95dad6c2ae5","year":2013},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:5d1eab34630dbc5c0569b83f2e89a56bed9eca82fa765c6d0aabf25243407d98","observation_id":"d207f5f3-abf6-4604-883a-e28d5d600a40","resolution":{"observed_at":"2026-05-21T10:04:59.541373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The pontryagin maximum principle in the wasserstein space.Calculus of Varia- tions and Partial Differential Equations, 58:1–36","venue":null,"work_id":"26a280f7-82d6-421d-81eb-87b7b08592ca","year":2017},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:ef8a7b3056c9471d5e24f346c85e5b3dd473cff561598b1e088d269f8a5629ea","observation_id":"8808a4bd-8df7-4f47-9962-32a1d05c70bc","resolution":{"observed_at":"2026-05-21T10:04:59.543446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A general maximum principle for SDEs of mean-field type.Applied Mathematics and Optimization, 64(2):197–216","venue":null,"work_id":"72b75980-40d5-41cf-a239-7bc383cc1b27","year":2011},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:9a3b90eba70046b331ce8f5ee37e05503004b1bf2e564f877dcf9ea9d65f0422","observation_id":"82a92baa-4dc1-41c9-a578-9f3ef272a291","resolution":{"observed_at":"2026-05-21T10:04:59.545572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean-field stochastic differential equations and associated pdes.Annals of Probability, 45(2):824–878","venue":null,"work_id":"58b17eed-8d79-4907-9911-cc26c64c831d","year":2017},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:ec2704a4969a219ebb28b8afcf54347e34b7b537ec2b3fc893e5b6609121375c","observation_id":"ba044ed8-9990-4128-b5b3-6aef188d1762","resolution":{"observed_at":"2026-05-21T10:04:59.552625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Max Reppen, and H","venue":null,"work_id":"011b4440-3bc4-4530-9513-7ac06a635697","year":2020},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:22609f9f8dc35b32ce626d6292cea05b2c83293cdb4dfcae2aab805f0ef0e7f2","observation_id":"96513dbb-d7f9-4d98-9e53-619747b34459","resolution":{"observed_at":"2026-05-21T10:04:59.554409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Society for Industrial and Applied Mathematics (SIAM), Philadelphia, PA","venue":null,"work_id":"34ba27de-12a5-40c4-8ff6-992be4954ac8","year":2016},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:1019b42cc9c485251a264cd4153330768a634507455d374476ecd3c8bf6add99","observation_id":"28402ac9-17e9-4ff0-a63d-9e00d9396c1c","resolution":{"observed_at":"2026-05-21T10:04:59.492668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forward–backward stochastic differential equations and controlled McKean– Vlasov dynamics.Annals of Probability, 43(5):2647–2700","venue":null,"work_id":"e893911a-c1e8-419b-a1ae-c232a3bafd61","year":2015},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:3bc4a8648164f1769577757a7f4e03e467c4d4388c4f7d5f30dbb5bfb8454f9c","observation_id":"cd547b01-babd-46d0-954b-242c9ce3612d","resolution":{"observed_at":"2026-05-21T10:04:59.512969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"I, volume 83 of Probability Theory and Stochastic Modelling","venue":null,"work_id":"a6c38133-3a4c-482e-83a7-45126c510476","year":2018},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:64f2b10cad97cc64c87bc8da3f77f521ce6dc9a31f14501135ec2b3ca871580c","observation_id":"b49508fa-a66b-437d-9356-dfcd4c8e5a95","resolution":{"observed_at":"2026-05-21T10:04:59.564121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"II, volume 84 of Probability Theory and Stochastic Modelling","venue":null,"work_id":"7bf50fa5-951c-41af-a324-422a3cc3b8e1","year":2018},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:829713352cbd2599037af506ccde402aef806e6d6251abebaf14677dc8feabc4","observation_id":"9c8ac905-bf30-40a9-8e0b-c0e701503751","resolution":{"observed_at":"2026-05-21T10:04:59.460554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Control of McKean–Vlasov dynamics versus mean field games","venue":null,"work_id":"f0811d66-f86b-4d2b-b147-7cd48551126b","year":2013},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:3eebb6461324480a66560446190be33e0e16da148279ec4f9c438267a19e1ee4","observation_id":"33e76a54-c660-4cfc-81fa-eb33ed096991","resolution":{"observed_at":"2026-05-21T10:04:59.462811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean field games and systemic risk.Communications in Mathematical Sciences, 13(4):911–933","venue":null,"work_id":"79586d1e-5ff6-4896-ba85-eaa560d56fdb","year":2015},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:f036d5d6ec024c5ff567ffc2969eb1dc9c060aa0c5281c7bfbe1aa6159fe4c63","observation_id":"3ec279bb-67a8-4c4e-bb19-ac77d2674b18","resolution":{"observed_at":"2026-05-21T10:04:59.467872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a89a8666-5f83-45b7-8c6f-3f7629d463f1","year":2022},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:ec889741fa961433cc382895259283eaae8eb8e3241c2705fc7465abe82fb0a3","observation_id":"5db4fbbe-c53a-4e30-916c-e4fb5ee5636b","resolution":{"observed_at":"2026-05-21T10:04:59.536369Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04295","last_updated":"2025-04-28T23:55:02Z","snapshot_observed_at":"2026-07-06T08:28:15.985260Z","submitted_at":"2019-10-09T23:19:39Z","title":"Linear-Quadratic Mean-Field Reinforcement Learning: Convergence of Policy Gradient Methods","version":2},"cited_work":{"arxiv_id":"1910.04295","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.04295","snapshot_observed_at":"2026-07-04T14:09:53.348942Z","title":"Linear-quadratic mean-field reinforcement learning: Convergence of policy gradient methods.Preprint","venue":null,"work_id":"662c3019-9084-403d-83d5-249a954ca460","year":1910},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"cited_paper":"/paper/1910.04295","citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:2681945849a0276c5333a792162958d9ee2c146919f931cd22db7a46a7ba59cc","observation_id":"48c6c7de-978a-48f0-b6ba-e4f829410715","resolution":{"observed_at":"2026-05-21T04:19:33.507409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Carrillo, Young-Pil Choi, and Maxime Hauray","venue":null,"work_id":"e774b36f-3d62-43ea-ba0f-808231bfd4f0","year":2014},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:65e03f043ae5a748027b396050475246e61a177df770a8dc8c9743a3749ad6b9","observation_id":"d99aaeb9-1669-40bc-9057-5e59ec113a97","resolution":{"observed_at":"2026-05-21T10:04:59.397202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Carrillo, Massimo Fornasier, Giuseppe Toscani, and Francesco Vecil","venue":null,"work_id":"f9294784-3222-4f1b-bae4-ec5805273665","year":2010},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:9f6fb04b514f761f93065847915fee068d7b4dd5cb901146b8126b600c46d29f","observation_id":"0e36a81f-ea3d-4d28-808f-6a37742f26e7","resolution":{"observed_at":"2026-05-21T10:04:59.457906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Propagation of chaos: A review of models, methods and applications","venue":null,"work_id":"e0dc50dc-3b08-4b39-a288-e9ecae5874a4","year":2022},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:a0e81a42f4440770b0c5c0106922cd1241dd2aeb3539b2da67529be6841e6df5","observation_id":"c4f9cfa8-aaae-4a02-b634-f9e9ab96c9d1","resolution":{"observed_at":"2026-05-21T10:04:59.559847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numerical method for FBSDEs of McKean–Vlasov type.Annals of Applied Probability, 29(3):1640–1684","venue":null,"work_id":"df637fc1-d7a4-40f2-88e1-d7ce0023ed08","year":2019},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:bbd38ea164f135e6d5d0159b7b285558604f007db88ff0a5e0d7299ecca57b3c","observation_id":"4f1a21e8-3e36-4c01-9bb5-76742afaa769","resolution":{"observed_at":"2026-05-21T10:04:59.473218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emergent behavior in flocks.IEEE Transactions on Automatic Control, 52(5):852–862","venue":null,"work_id":"1c06a440-9b47-40bd-949d-b4a387bf12ce","year":2007},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:b51e1c28eae763343a14ada0b64ee256c61bc6a2df2b14c48e219dfe5db2b100","observation_id":"9cdb784c-2560-41da-8ed4-3fca87cd6654","resolution":{"observed_at":"2026-05-21T10:04:59.447406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mckean–vlasov optimal control: Limit theory and equivalence between different formulations.Mathematics of Operations Research, 47(4):2891–2930","venue":null,"work_id":"c4cde358-2eb4-4f3a-910c-cb8e25ef4935","year":2022},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:d45fe91b24d93dabc4656ca697730de130a56ef71c013bbbd60a690309188140","observation_id":"53120db2-2bdb-42f9-935b-c6334b7ed650","resolution":{"observed_at":"2026-05-21T10:04:59.452538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Martingale measures and stochastic calculus.Probability Theory and Related Fields, 84(1–2):83–101","venue":null,"work_id":"aed2740f-d13e-4401-b354-19d4ef61c383","year":1990},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:7bbe8b110fce21fcf576b48c6bb1324fd33a481b28276b2c9a3715444eaefa16","observation_id":"e6713b11-f19b-481a-a0dc-f6ed3517fff9","resolution":{"observed_at":"2026-05-21T10:04:59.444803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actor-critic learning for mean-field control in continuous time.J","venue":null,"work_id":"c52ea015-04c4-45fd-aea1-918e1fd4af58","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:da8df3eab06845dc41acf0a3aaf8636ccf2b7501e3111fb9b3c0c75a1e6df146","observation_id":"e0e10495-ee5a-4664-8447-ddaa699b2b09","resolution":{"observed_at":"2026-05-21T10:04:59.449933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02489","last_updated":"2024-08-05T14:11:51Z","snapshot_observed_at":"2026-08-06T15:55:12.024773Z","submitted_at":"2024-08-05T14:11:51Z","title":"Full error analysis of policy gradient learning algorithms for exploratory linear quadratic mean-field control problem in continuous time with common noise","version":1},"cited_work":{"arxiv_id":"2408.02489","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02489","snapshot_observed_at":"2026-07-04T14:09:53.345401Z","title":"Frikha, H","venue":null,"work_id":"03beca42-153a-434f-8bc0-384aca361c5a","year":2024},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"cited_paper":"/paper/2408.02489","citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:b9ca4b9cc30e5247dd5842bf325f2439409603c31217ab7a10f8e4765253ca91","observation_id":"b91cba99-3aef-4121-adbf-7a019cae5bc3","resolution":{"observed_at":"2026-05-21T04:19:33.522026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hamilton-Jacobi equations in the Wasserstein space.Methods Appl","venue":null,"work_id":"2ec9c643-41d0-4fdd-992c-d8df35b4363d","year":2008},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:e0953b587cc5db7ba92b67e2c4492fd8104e6ce83807f07478616627d85749bc","observation_id":"4ab26cd6-e292-4b09-871d-98e5010e1d6e","resolution":{"observed_at":"2026-05-21T10:04:59.561911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opinion dynamics and bounded confidence: Models, analysis and simulation","venue":null,"work_id":"730f9e9a-1be7-4c67-9e19-a3f54724211d","year":2002},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:55407a68885eb65bd640474d1284281e165b63ce93e488428e1a44d811992af1","observation_id":"59dcfc00-79c1-44c8-a0ed-aab8e9abf1d5","resolution":{"observed_at":"2026-05-21T10:04:59.436610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Howard.Dynamic programming and Markov processes","venue":null,"work_id":"57d862b2-077c-4169-9fc1-a0f85a1b5684","year":1960},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:7f2df10aa808248721927e826da2d56e69c4c92126227f60bea5419dfac59799","observation_id":"498872b3-5e19-41c8-a718-7b7eff381ecf","resolution":{"observed_at":"2026-05-21T10:04:59.404624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A linear-quadratic optimal control problem for mean-field stochastic differential equations in infinite horizon.Math","venue":null,"work_id":"4896ae8e-3e7a-438a-9ef3-b5c09f07ec6f","year":2015},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:1338d1d3d8beba8ecbd5421eec35ceab75c55a96c10ec1250a7d5c4a118bb2d6","observation_id":"b2d33492-3963-43e9-b498-24bc11a715c3","resolution":{"observed_at":"2026-05-21T10:04:59.475956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infinite horizon value functions in the Wasserstein spaces.J","venue":null,"work_id":"d6928bfa-5f0c-4228-94ee-9c26e8bce1ff","year":1933},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:94de5ce4bbcc9c908159cbc741ff92cd0b2e21c67678f00429396648d11dadb5","observation_id":"a31369c5-5175-4a8b-a28a-a19960545c0d","resolution":{"observed_at":"2026-05-21T10:04:59.434217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:09:53.359840Z","title":"Accuracy of discretely sampled stochastic policies in continuous-time reinforcement learning","venue":null,"work_id":"d13d6263-cc59-4b9f-b60c-07157c1a048e","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:79950179b900ca9e16f156c80d3fbd80bfe8b5c8db6233103d429f6b321b588e","observation_id":"d9d8dd3c-e052-4017-aee4-6d552d7b7668","resolution":{"observed_at":"2026-05-21T04:19:33.511413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy evaluation and temporal-difference learning in continuous time and space: A martingale approach.Journal of Machine Learning Research, 23(1):6918–6972","venue":null,"work_id":"15092425-039f-4d04-80f4-498aa5c27845","year":2022},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:f2e989f60614afaafb06129fec975dd96ed6c81f3700c69acc298f33f8ce0c8f","observation_id":"99f04930-10d8-40bc-bc74-82556801903d","resolution":{"observed_at":"2026-05-21T10:04:59.522899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy gradient and actor-critic learning in continuous time and space.Journal of Machine Learning Research, 23(1):12603–12652","venue":null,"work_id":"118396c4-da6a-4de7-b184-733c25a5c309","year":2022},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:49cb7b60e9e47a074bc299772fc23e52f134beb9ae15c4a350f91059c1d62f78","observation_id":"1c89e2b0-8c49-498e-b000-4347767a5658","resolution":{"observed_at":"2026-05-21T10:04:59.480561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"503ac120-8505-4056-81b9-bb0165aca927","year":2023},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:cf38a558ee015ec9bf7b8d7fd4624da2bca83e9b9abe1ce07118fcdf0ac82da5","observation_id":"be968192-42a4-443c-be7d-a8692dc2f708","resolution":{"observed_at":"2026-05-21T10:04:59.428864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4002f84c-fb04-47cb-877e-a4d7a319beb0","year":2020},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:d0ce43ae932c5bcea3eaf3705cb36b2c69a86b9a44b4293a34cd6b75be7bfbd4","observation_id":"08a394e0-e2db-4bbf-b050-766fcd1d206e","resolution":{"observed_at":"2026-05-21T10:04:59.529917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Limit theory for controlled McKean–Vlasov dynamics.SIAM Journal on Control and Optimization, 55(3):1641–1672","venue":null,"work_id":"c399ba44-ac23-4461-a03e-146f44d752e9","year":2017},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:3ca4d0161a28d27df30b835cf6e8fc57e375de3c66a271b65f4b966a0ef9a4fe","observation_id":"17085b17-2973-44a8-b454-a1f6ccb74323","resolution":{"observed_at":"2026-05-21T10:04:59.487899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean field games.Japanese Journal of Mathematics, 2(1):229–260","venue":null,"work_id":"808bc67a-6004-448e-a350-fb007d574b57","year":2007},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:85bf3a47418660a1f6480c73699965802927d02a7361e524f28987ef4c933fe6","observation_id":"b1a2b330-50da-41ab-8bb1-ddb4cc4f77d2","resolution":{"observed_at":"2026-05-21T10:04:59.482972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numerical methods for mean field games and mean field type control.Proceedings of Symposia in Applied Mathematics, 78:221–282","venue":null,"work_id":"7e77cd4b-ce01-43b8-98e8-32cf68626a83","year":2021},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:847d19c0f4fcec18bc99df20de20d09d685ee8c27418d506f78aeb526b917b6a","observation_id":"6871f50e-e74e-466b-bab9-4bbf6a2e86d8","resolution":{"observed_at":"2026-05-21T10:04:59.534428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic programming for mean-field type control.Comptes Rendus Math´ ematique","venue":null,"work_id":"0f9f6fda-c176-427e-a1a9-80bfd6f7e575","year":2014},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:e462870090afc19570e812234c7c157b7500d5ca74f75459bc0e24665c677cbb","observation_id":"8b2ef5be-d50f-4397-9b32-d6569ec2a66c","resolution":{"observed_at":"2026-05-21T10:04:59.532000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean-field stochastic linear quadratic optimal control problems: Closed-loop solvability.Probability, Uncertainty and Quantitative Risk, 1(1):2","venue":null,"work_id":"a4f57b8a-b328-4f7e-aaed-c1cb2b72ecd3","year":2016},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:13d3b21cc345413553809bf2616f364454c95b0b3dc3b6fddf9df5b7ca171aae","observation_id":"750f29c2-a508-46ea-a5f9-d833186900ac","resolution":{"observed_at":"2026-05-21T10:04:59.485361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cours au Coll` ege de France: Th´ eorie des jeux ` a champ moyen","venue":null,"work_id":"a82e1615-d3ce-43c8-868f-a0c24d45abed","year":2012},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:5451f6aa9a56303bc29feb3c97ac23333ea6b917391f3b3ca363e5b8b0940f7b","observation_id":"a896a42a-f91f-4b0f-974c-5f53b29afb26","resolution":{"observed_at":"2026-05-21T10:04:59.426546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear quadratic optimal control of conditional McKean–Vlasov equation with random coefficients and applications.Journal of Mathematical Economics, 66:7–26","venue":null,"work_id":"5ae692bd-fa84-4553-97ae-51b0d04c4e5b","year":2016},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:f4bd8b8c8879fc40e038cb73d7e94a804e77d83c77819222bf270fbca3f42942","observation_id":"c6f34b89-825b-4fcc-8308-0c01065439f3","resolution":{"observed_at":"2026-05-21T10:04:59.431615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actor-critic learning algorithms for mean-field control with moment neural networks","venue":null,"work_id":"31ea2aad-0cd4-459d-a8cf-0ceedba763f6","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:02375fdac009777442083d5c3eb36148f5d30e07862a91c8537b3f4e22753ce4","observation_id":"a0d208c2-9953-4632-96ef-429bee3168c7","resolution":{"observed_at":"2026-05-21T10:04:59.439243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamic programming for optimal control of stochastic McKean–Vlasov dynamics","venue":null,"work_id":"f64f8249-b54e-4762-a076-79797ae6f4d6","year":2017},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:1a0fd9a049cab9a35c8957d4495bbf7806bb14143e6e57a263b6823fe2532009","observation_id":"73951ded-2a0f-448b-a4c4-607421a6fb57","resolution":{"observed_at":"2026-05-21T10:04:59.495075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bellman equation and viscosity solutions for mean-field stochastic control problem","venue":null,"work_id":"48b216aa-5f5c-4ec3-8423-cf45bfd9b00a","year":2018},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:64a110c0a4158890621b700504d2dfe570ff7dba3b25a882b3d4917ca5a1b439","observation_id":"33d2da7e-64cc-45b0-996d-4e149cbfe98a","resolution":{"observed_at":"2026-05-21T10:04:59.419115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean-field neural networks: Learning mappings on wasserstein space.Neural Net- works, 168:380–393","venue":null,"work_id":"c1c0495b-5f58-4ad2-bce5-fb7635faf9c0","year":2023},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:b0dfa7f83930e8d5a5a90ae663eb868b9196fbb96624ee0602963abf7d58f8f7","observation_id":"ee922660-e942-4f26-9215-b07d7eaf58b9","resolution":{"observed_at":"2026-05-21T10:04:59.424023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous-time q-learning for mean-field control with common noise, part-i: Theoretical foundations","venue":null,"work_id":"664defd5-33fc-477c-9413-e4311e407678","year":2026},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:7c1a66ac30bf8fff75f676d0ea01074943c4b82bbe48050045b60bc19ea73937","observation_id":"5d6cec1d-165e-412e-b94c-f66e66f1fec7","resolution":{"observed_at":"2026-05-21T10:04:59.416581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous-time q-learning for mean-field control with common noise, part-ii: q-learning algorithms","venue":null,"work_id":"5394c534-5cfd-4800-afa6-365669af1198","year":2026},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:0cb35131d7d5d370b0a0c51a9634743d9b6b3208868f77f6b4f0a09354fe7e57","observation_id":"5c65b131-2f3d-47b2-a3ec-500ec902646c","resolution":{"observed_at":"2026-05-21T10:04:59.421629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Osher, Wuchen Li, Levon Nurbekyan, and Samy Wu Fung","venue":null,"work_id":"a983b5da-9b93-4faa-92a9-5075f5ff91ea","year":2020},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:d50fa34ef399593c393d258fa63c2ccc622894a712d63f306e0fb2542d9dfce1","observation_id":"7f8605af-8b72-47ce-80d7-d89af6336aec","resolution":{"observed_at":"2026-05-21T10:04:59.441828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17869","last_updated":"2025-03-22T22:07:59Z","snapshot_observed_at":"2026-08-07T16:43:53.349092Z","submitted_at":"2025-03-22T22:07:59Z","title":"Learning algorithms for mean field optimal control","version":1},"cited_work":{"arxiv_id":"2503.17869","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.17869","snapshot_observed_at":"2026-07-04T14:39:57.166065Z","title":"Mete Soner, Josef Teichmann, and Qinxin Yan","venue":null,"work_id":"8b44504e-8f48-4399-bffa-47195567fe12","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"cited_paper":"/paper/2503.17869","citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:3a6faafb3b9815ee914a1b4b7ebfd3d0de03b740ba0c28fe0ceb04781498f5f2","observation_id":"288cf3e9-8ef0-43b6-bcb8-7d44fc1e9bb3","resolution":{"observed_at":"2026-05-21T04:19:33.514765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mete Soner and Qinxin Yan","venue":null,"work_id":"6a1beeac-f228-4a18-9878-4732f3367b7c","year":2024},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:36955a17be2a030445244778b65630dd6926541a105b219f01c7b0070cd55460","observation_id":"695a9fc3-c832-493b-bb48-f36ca5edef3e","resolution":{"observed_at":"2026-05-21T10:04:59.550478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mete Soner and Qinxin Yan","venue":null,"work_id":"894de1ab-ce77-4ab7-ba37-7ad8d6329ec3","year":2024},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:2478cba09497a9b2a652b9bf387081ad051d88babe1dec0fd4eb0af984f9b5be","observation_id":"a27f048f-3d6b-469f-95d9-e39eb45c394e","resolution":{"observed_at":"2026-05-21T10:04:59.409253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean-field stochastic linear quadratic optimal control problems: Open-loop solvabilities.ESAIM: Control, Optimisation and Calculus of Variations, 23(3):1099–1127","venue":null,"work_id":"9472c434-9108-43c4-91ee-4bdeefea1389","year":2017},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:468909474e22b5c200f0f88b473cdafc294d0103213108175e5c26a0feee6d6f","observation_id":"215e1ce4-f58b-40b7-81f5-bba0820c2935","resolution":{"observed_at":"2026-05-21T10:04:59.384181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mean-field stochastic linear-quadratic optimal control problems: Weak closed-loop solvability.Mathematical Control and Related Fields, 11(1):47–71","venue":null,"work_id":"e8a50b7f-a1ae-4d52-9d33-1c0c17243205","year":2021},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:ca811db182de39121a5a011a446e6720d318332336474d1f70888ab122ff3767","observation_id":"8eeaf5bf-84c3-4b26-96da-ee7a43ae9c64","resolution":{"observed_at":"2026-05-21T10:04:59.381332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Springer Nature","venue":null,"work_id":"0009a0a1-f5ae-428c-b1e9-7e87d2e4e6e4","year":2020},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:1609488a02cafa7ae4a0b504a22e2c82049d791a9d4a312a0e5f45ed9588be75","observation_id":"97ec6ec2-e7f9-4206-81c6-2dd49cdf60c4","resolution":{"observed_at":"2026-05-21T10:04:59.455576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The exact law of large numbers via fubini extension and characterization of insurable risks.Journal of Economic Theory, 126(1):31–69","venue":null,"work_id":"171fde7d-b079-49c5-b5af-5d3a6bb5eda7","year":2006},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:d8e7c3a8d75288839f633db32ed891a1eaa527ba489fd77be09e58ba61f9ea33","observation_id":"695e3a34-7ebb-4324-b980-ef4580092137","resolution":{"observed_at":"2026-05-21T10:04:59.504533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sutton and Andrew G","venue":null,"work_id":"b20a2f03-0e13-44eb-bd01-fb182c937c0e","year":2018},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:0dcf7c7cf311e555967684371fe9155383766dd72239dcc73824ca39fa408aa6","observation_id":"27c5ee06-cd2e-46ce-b259-15c9c6894deb","resolution":{"observed_at":"2026-05-21T10:04:59.414273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthesis Lectures on Artificial Intelligence and Machine Learning","venue":null,"work_id":"b9eea90a-b21d-4cd1-adaf-eb2e08ecea63","year":2010},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:180412326928d6289ca9dad0ec8c07759e77f7b7ebf1b7bcde776202a8f602e9","observation_id":"ee42fb72-20b3-4147-ae61-4e6c5795b0c1","resolution":{"observed_at":"2026-05-21T10:04:59.502141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Topics in propagation of chaos","venue":null,"work_id":"a515de19-d2e8-4ce9-beba-85b8ab8c970a","year":1989},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:f79ba58224866cf47f531eaa9e036134808e3c4671364227a643ccdad1e21a92","observation_id":"cb9dc937-8511-442d-901c-1fa2ce1b82d5","resolution":{"observed_at":"2026-05-21T10:04:59.525348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimal scheduling of entropy regularizer for continuous- time linear-quadratic reinforcement learning.SIAM Journal on Control and Optimization, 62(1):135–166","venue":null,"work_id":"cfc262c6-5cf5-4edf-8923-130dc18eff5e","year":2024},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:596d5f6f5fa8422121f4c8654316d5c16ee600efd622e89aa639ebe16ef6fb31","observation_id":"db9aa6b9-6bc6-4496-bcfd-b45ad55f4b41","resolution":{"observed_at":"2026-05-21T10:04:59.402198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making deep Q-learning methods robust to time discretization","venue":null,"work_id":"68a6ac2d-6115-4313-a7a8-879bef1253c0","year":2019},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:f14eb02c3f83be97c5b4d5897076d106899d9b1ca9e8edde3f79c1d693f53376","observation_id":"b5b60a16-c453-4f04-9944-54b1f1d33506","resolution":{"observed_at":"2026-05-21T10:04:59.407104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kinetic models of opinion formation.Communications in Mathematical Sciences, 4(3):481–496","venue":null,"work_id":"2b70d80c-15d7-49bc-b921-425b5ef78d0b","year":2006},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:bcc00c64cffd7fe85b53ac181fabdabbf8e0ead55615892826869fbd1f6bdaaa","observation_id":"e7fbaa1d-bd78-42ed-af19-367c06530e3c","resolution":{"observed_at":"2026-05-21T10:04:59.389495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning in continuous time and space: A stochastic control approach.Journal of Machine Learning Research, 21(198):1–34","venue":null,"work_id":"c400e962-1dfa-4c69-97ef-593fd4850ff5","year":2020},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:6af350e2ae20b5e6da460420aa8d9ce443117227ae8da3acdc08b7dbb3261b14","observation_id":"f5f4cf72-5e45-4958-adc9-34d24c3fe061","resolution":{"observed_at":"2026-05-21T10:04:59.386913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Global convergence of policy gradient for linear- quadratic mean-field control/game in continuous time","venue":null,"work_id":"7a48fa80-8619-4af5-acc9-43c03a8ea81b","year":2021},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:8bd74fc15636969c3f40ae2bb4de99c5721c577d8f06d50ff9542234debae433","observation_id":"b1047761-c87e-4955-a12a-fac5d9b565e0","resolution":{"observed_at":"2026-05-21T10:04:59.411820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous time q-learning for mean-field control problems.Applied Mathematics & Opti- mization, 91(1):10","venue":null,"work_id":"1e7f85cc-1852-401b-a9ed-cf8e7e4e7730","year":2025},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:4ec40e0dc03884185f3a973c40a9777da151925a654c1e0959c40b7224acb9f9","observation_id":"0093bcd8-b17e-4bc6-a2cb-298d91ca5470","resolution":{"observed_at":"2026-05-21T10:04:59.547797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04521","last_updated":"2026-07-31T08:57:04Z","snapshot_observed_at":"2026-08-06T03:14:08.152047Z","submitted_at":"2024-07-05T14:06:59Z","title":"Unified continuous-time q-learning for mean-field game and mean-field control problems","version":3},"cited_work":{"arxiv_id":"2407.04521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.04521","snapshot_observed_at":"2026-08-03T01:10:22.407760Z","title":"Unified continuous-time q-learning for mean-field game and mean-field control problems.ArXiv, abs/2407.04521","venue":null,"work_id":"468f7729-7686-4129-a45d-097408fb6b22","year":2024},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"cited_paper":"/paper/2407.04521","citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:c39c29b257ea47e19b575fcc293266c3fefdabe34b69f7316e18b55627e188b0","observation_id":"e5db062e-971d-4d5a-86c4-ebd664ea8d69","resolution":{"observed_at":"2026-08-03T01:10:22.407760Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient local planning with linear function approximation","venue":null,"work_id":"07f28604-ecaa-43fd-990a-2325329a7b72","year":2022},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:e237842a22b5ff60fb8c4ab0872424e3e72af13a4fb3b26c765119d56850d165","observation_id":"77da7314-7111-4e8d-a5b9-4924946a5b33","resolution":{"observed_at":"2026-05-21T10:04:59.465245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear-quadratic optimal control problems for mean-field stochastic differential equations.SIAM Journal on Control and Optimization, 51(4):2809–2838","venue":null,"work_id":"1abdd080-8ac0-49af-bc61-f1a9440991e7","year":2013},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:b59edb04f60f8ac552f5512d241d624bbafc857e67a56223efd50262075a8c9a","observation_id":"50d101de-2164-4cc4-b593-91e8ba4da176","resolution":{"observed_at":"2026-05-21T10:04:59.557643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.12535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:09:53.352765Z","title":"PhiBE: A PDE-based Bellman equation for continuous time policy evaluation","venue":null,"work_id":"ec7f9ff1-d42c-4e7b-a44c-335e01e2ab99","year":2024},"citing_paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-21T04:15:32.156380Z"},"links":{"citing_paper":"/paper/2605.20718"},"observation_digest":"sha256:dca1554d27badd89e501cc22c99c15b614fab7a68794957530b39495f3a89754","observation_id":"5c5ca38c-7cdb-48f8-adcb-87334f300f85","resolution":{"observed_at":"2026-05-21T04:19:33.525856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20718","last_updated":"2026-05-20T05:19:53Z","latest_version":1,"primary_category":"math.OC","snapshot_observed_at":"2026-07-06T23:31:18.520630Z","submitted_at":"2026-05-20T05:19:53Z","title":"Policy Gradient for Continuous-Time Mean-Field Control"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":6,"verified_fuzzy":70},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 1 inbound Pith citation observation for arXiv:2605.20718."}