{"as_of":"2026-08-10T12:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:617ef4890f99b4e2ad4d5eb5d45a2c50ceeb2f926fc26bf52afb923a35232248","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:10:27.705945Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T01:17:41.135172Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T01:27:02.760603Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"cited_work":{"arxiv_id":"2505.22781","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22781","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finite- sample convergence bounds for trust region policy optimization in mean-field games","venue":null,"work_id":"9a2588ba-c2cb-4c3a-9b28-9c78995960eb","year":2025},"citing_paper":{"arxiv_id":"2605.11042","last_updated":"2026-05-11T08:39:30Z","snapshot_observed_at":"2026-08-02T19:41:03.067207Z","submitted_at":"2026-05-11T08:39:30Z","title":"Towards Model-Free Learning in Dynamic Population Games: An Application to Karma Economies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T01:17:41.135172Z"},"links":{"cited_paper":"/paper/2505.22781","citing_paper":"/paper/2605.11042"},"observation_digest":"sha256:b1f25766ff650bca9e37f19f52d1f521faee9998503d24313fbbd80b770c38ed","observation_id":"d4fce0ae-be86-4a46-ab5c-2eb9ce8dd9b7","resolution":{"observed_at":"2026-05-13T01:27:02.762569Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22781/citation-record","integrity":"/paper/2505.22781/integrity","json":"/paper/2505.22781/citation-record.json","paper":"/paper/2505.22781"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.196564Z","title":"and Capuzzo-Dolcetta, I","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.196564Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:1d7e050f099341e9414aac128a45e39cef9479cb7a70dbd54f75cbd50d6d07c5","observation_id":"bf637fce-5932-47bb-a84d-fccde22410ae","resolution":{"observed_at":"2026-08-07T13:10:12.196564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.329482Z","title":"and Porretta, A","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.329482Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:613b626fbb6d0dd48566eb6c2defa106ae81abbafca525ca76419dc3b909b1b1","observation_id":"4a6670e5-2aa5-40cc-b372-5d783f349faa","resolution":{"observed_at":"2026-08-07T13:10:12.329482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.491661Z","title":"Mean field games: numerical methods for the planning problem","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.491661Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7717b74606d0a9e5668348977726719b0a4fbbbfdfbe63c69725f1588de6e0d8","observation_id":"453d78a0-a8be-4b55-9a06-4050d75d6c03","resolution":{"observed_at":"2026-08-07T13:10:12.491661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.619752Z","title":"Mean field games and applications: Numerical aspects","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.619752Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:9310dad3b2a1834659b85eb1b80064d5a1f00fa2a5b707ab0fbf761c881400ab","observation_id":"ccbebb40-1486-421b-adef-e6689a6eff64","resolution":{"observed_at":"2026-08-07T13:10:12.619752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:12.806388Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:12.806388Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:b44df69ce52bbd50e10a8966adb28ef120a9c9d0917314ec263709771966afd4","observation_id":"50fb8c21-04b9-48c5-9ee9-c258f2db1281","resolution":{"observed_at":"2026-08-07T13:10:12.806388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.017801Z","title":"An extended mean field game for storage in smart grids","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.017801Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:4e43b84c9386f1bb9ddf5e431e45a1d65114c2f9c868b3f381474bc21bef7565","observation_id":"99b8884a-b888-4366-8840-6503594e9d34","resolution":{"observed_at":"2026-08-07T13:10:13.017801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.221565Z","title":"Regularization of the policy updates for stabilizing mean field games","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.221565Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:316ee36967d6ec0c674e2084908db4de7c36cfd9342cc07f18a895ee4de63433","observation_id":"5c2ea739-69c9-4425-b6bb-f1b752ee86ad","resolution":{"observed_at":"2026-08-07T13:10:13.221565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.373064Z","title":"D., and Saldi, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.373064Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7e09f9b9176e7529e0c6d2b85c48e911e3e08b80aba668be1ceb0027f8be2b02","observation_id":"68a8815d-4929-4184-b623-1ef5e7930c55","resolution":{"observed_at":"2026-08-07T13:10:13.373064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.491777Z","title":"D., and Saldi, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.491777Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7c65ea7e3db8978502e5356e55a1d82732497da129bc559d9baf2364437fb7c9","observation_id":"5f18d09d-74d5-4ad8-aa92-cd8971e47d3c","resolution":{"observed_at":"2026-08-07T13:10:13.491777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:13.621544Z","title":"Mean-field sampling for cooperative multi-agent reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.621544Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:087903970af0e5555782ab825f42d83f6d01d83b57e3fb8a6a46c460b3b411f2","observation_id":"29ad1f48-6d67-45d6-8117-15ccfb0cfe63","resolution":{"observed_at":"2026-08-07T13:10:13.621544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13912","last_updated":"2021-05-31T17:08:26Z","snapshot_observed_at":"2026-07-06T09:32:26.221291Z","submitted_at":"2020-06-24T17:45:44Z","title":"Unified Reinforcement Q-Learning for Mean Field Game and Control Problems","version":3},"cited_work":{"arxiv_id":"2006.13912","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.13912","snapshot_observed_at":"2026-08-07T13:10:28.428600Z","title":"Unified Reinforcement Q-Learning for Mean Field Game and Control Problems","venue":"math.OC","work_id":"5c6c14af-37f6-41c5-8944-89b0fa6ef70f","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.774546Z"},"links":{"cited_paper":"/paper/2006.13912","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:11ec9fe2f39cd2f9839dcd12772c41e81b574fb7bf6b02e9d0ccccaf819494a8","observation_id":"570de5b3-c6e6-4ed4-84d7-b2cd89a7bb11","resolution":{"observed_at":"2026-08-07T13:10:28.517786Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06659","last_updated":"2024-05-01T11:23:58Z","snapshot_observed_at":"2026-08-08T05:37:10.238060Z","submitted_at":"2023-12-11T18:59:51Z","title":"Convergence of Multi-Scale Reinforcement Q-Learning Algorithms for Mean Field Game and Control Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06659","snapshot_observed_at":"2026-08-07T13:10:13.932048Z","title":"Convergence of multi-scale reinforcement Q learning algorithms for mean field game and control problems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:13.932048Z"},"links":{"cited_paper":"/paper/2312.06659","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:2bdb16eb7b2ce1ff29dc56bc07425951e14c54cd8c27d439c94cd40f2528c6ba","observation_id":"a115e582-f4c1-4f97-874b-d709fb4e066e","resolution":{"observed_at":"2026-08-07T13:10:13.932048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.074540Z","title":"On solutions of mean field games with ergodic cost","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.074540Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:dd3c36e31d2bb1c871f7357ea1fbeb6a2e493488f8b42e7e572f1092307883c0","observation_id":"d9faeb28-e1ab-46f7-9b5b-4d91e7518fbd","resolution":{"observed_at":"2026-08-07T13:10:14.074540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.243790Z","title":"Lipschitz continuity in model-based reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.243790Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:0ce207c053fc199dbc75c1a85578e1d7e926e4da643e5bc3eaa11c6f2186fc64","observation_id":"7c38864c-386d-4df4-b653-44aafd25fbe2","resolution":{"observed_at":"2026-08-07T13:10:14.243790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.377895Z","title":"Inapproximability of np-complete variants of nash equilibrium","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.377895Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:28916a85402ea4939b2d104e1ddd979a3ecc8acadf370893e3baf8d903ae129c","observation_id":"d1c12000-e29d-4a60-afc9-9eed044892e0","resolution":{"observed_at":"2026-08-07T13:10:14.377895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.540084Z","title":"M., Munos, R., and Kappen, H","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.540084Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:a78dc6155d9dcc418ef5ebd7b545f168a3b2d59f711dcdb4c2fb8f4d2ea88f01","observation_id":"cb65bbb7-a39b-440f-8e8e-874cfdae2ee1","resolution":{"observed_at":"2026-08-07T13:10:14.540084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.688053Z","title":"and Priuli, F","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.688053Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:8e5fa14e6ebac5ded779de7c382b45c7717eaf226f7331499c00b2928369489f","observation_id":"d527bfc3-31dc-47f3-9bcb-745d3b78ebf6","resolution":{"observed_at":"2026-08-07T13:10:14.688053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:14.886881Z","title":"A mean-field game model of electricity market dynamics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:14.886881Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:178b0d61d5c5d973abcc0c86f3277eb3fb20176084affd309219cd3bfe35770c","observation_id":"0bb83870-e706-48a0-8f24-a83d215f526a","resolution":{"observed_at":"2026-08-07T13:10:14.886881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.037956Z","title":"and Hesse, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.037956Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:ba111c144dd6a204325708c43b580d897d9012fb1ed59dae354a695c58e0fbf8","observation_id":"7a13ea33-c593-4ce7-b35b-3ddd47b16e40","resolution":{"observed_at":"2026-08-07T13:10:15.037956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.203972Z","title":"First-order methods in optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.203972Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:3f28ffa50fc79f86d855df21937c55c200df9ce809387f2d221fd374e7a56266","observation_id":"7d1e2b1d-41c2-481a-9346-d99ba8da6420","resolution":{"observed_at":"2026-08-07T13:10:15.203972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.404955Z","title":"and Russo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.404955Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:6df4d9ec56c531ce3774183b650e84196ae2d10721e4e6f1f0ff516e1922311c","observation_id":"be756859-2ab8-4cf2-a5ca-494054b2bbe8","resolution":{"observed_at":"2026-08-07T13:10:15.404955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.613780Z","title":"A., Ortega, P","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.613780Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:74cf376109bcffb4e946772cd2012159f1d212dc60daa6f2dc273322e394f1cf","observation_id":"48e4c65e-cc51-4081-b65b-5e4d78f9ff8f","resolution":{"observed_at":"2026-08-07T13:10:15.613780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:15.729213Z","title":"The master equation and the convergence problem in mean field games:(ams-201)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.729213Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c062923c19a9cdaf395874c13069d184f1fc10d0fcca0f5b0398f270d55a58c6","observation_id":"6bd91a86-fb64-40ac-8366-1dfc1730f3f9","resolution":{"observed_at":"2026-08-07T13:10:15.729213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.539957Z","title":"and Lauri \\`e re, M","venue":null,"work_id":"03b536e7-dd24-4fca-9ada-2da202627fa9","year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:15.885470Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:d9547ee067daff7a3eea18824b2ddaa7a3d71c1c976ab97b755ad7ab9ef7371f","observation_id":"7dce5b72-226e-41ef-bbc0-72f17a6825ad","resolution":{"observed_at":"2026-08-07T13:10:45.706097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.2172","last_updated":"2013-08-09T16:27:11Z","snapshot_observed_at":"2026-07-06T03:20:23.030252Z","submitted_at":"2013-08-09T16:27:11Z","title":"Mean Field Games and Systemic Risk","version":1},"cited_work":{"arxiv_id":"1308.2172","doi":null,"metadata_source":"pith","pith_arxiv_id":"1308.2172","snapshot_observed_at":"2026-08-07T13:10:28.078321Z","title":"Mean Field Games and Systemic Risk","venue":"q-fin.PR","work_id":"d8f82bde-8a8c-4f20-845a-2ab37d7df8a1","year":2013},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.063803Z"},"links":{"cited_paper":"/paper/1308.2172","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f7a29a35a17fa61525174fa7971db1b7a5049c5009dcd1521c682716b048067b","observation_id":"9096057d-4782-48ed-a291-3e6a5577120b","resolution":{"observed_at":"2026-08-07T13:10:28.223000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.277952Z","title":"Probabilistic theory of mean field games with applications I-II","venue":null,"work_id":"20b04884-3afe-4736-8fd2-b6f40f47d550","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.251055Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:fcd017143f73645cfd441ceed7375eaf6bfa6681c4a092bee643926a2f32cea7","observation_id":"db6ebada-1185-4011-b4e7-f9bebad60ca4","resolution":{"observed_at":"2026-08-07T13:10:45.413359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:45.027072Z","title":"Numerical method for fbsdes of mckean--vlasov type","venue":null,"work_id":"502539a9-d471-4448-b945-b08de479a7b7","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.373548Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:472023e9f1a0e4f25547cb7a96bd7df3ed6f51ecbb33f56d9f58e39570320fca","observation_id":"25424109-0fc2-4849-905e-af23cd3e2c59","resolution":{"observed_at":"2026-08-07T13:10:45.138057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:16.529488Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.529488Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:31246c7cd56e3e1cc062a552846694f74248c9322fcdde17c62c37d3828f97a4","observation_id":"6b9d0135-894c-417e-83a5-c4d104926724","resolution":{"observed_at":"2026-08-07T13:10:16.529488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.770365Z","title":"and Koeppl, H","venue":null,"work_id":"16f8b2c5-1252-44e9-a4aa-90a7be7ff76c","year":1909},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.744269Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:5545d973df2f2d1fe65add971f1d7599507a78a1ed4d8b95001da1337fa1b221","observation_id":"2e93f1e8-f4a9-473f-a040-9bb9bc1dec24","resolution":{"observed_at":"2026-08-07T13:10:44.865814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.432509Z","title":"and Koeppl, H","venue":null,"work_id":"78508d06-7da9-4ed3-9008-ef76198ad77e","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:16.855232Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:46698a931f8bfd9b4e386eac63be52cae83f75ee88d41c5ed0cc4109bc1ef834","observation_id":"27bbb1b0-3aba-4b92-9e01-73ad00a0db6d","resolution":{"observed_at":"2026-08-07T13:10:44.565375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:44.097564Z","title":"A mean field game analysis of sir dynamics with vaccination","venue":null,"work_id":"d09d6a75-f12c-4c8e-8bec-c8059f49d0f1","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.038129Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:53faebd39b392523b5b42618bde915db525b970a93ebec33dc09cf9581081b02","observation_id":"dec370c1-d457-45b3-bb97-7d9744f31cb0","resolution":{"observed_at":"2026-08-07T13:10:44.298047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.765689Z","title":"and Touzi, N","venue":null,"work_id":"e2a1930e-e0ba-47c6-8936-70706b8c52f0","year":2015},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.232176Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:889389211551e3db02b7d293ef672bee59792332d4cb20759b8e6150d7b028c5","observation_id":"dd77e7cb-60ec-45b4-9aab-1a478328e33f","resolution":{"observed_at":"2026-08-07T13:10:43.918293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.522497Z","title":"and Silva, F","venue":null,"work_id":"c45d2563-a389-44ac-a4c7-d4542abb3844","year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.431580Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:5e00bd0830a5f3690ffff23266ba11c1bc16bf085ad3e3fc79547af0b2c2d8d6","observation_id":"f47c2e38-69af-4291-97e3-dfd0e973e66b","resolution":{"observed_at":"2026-08-07T13:10:43.646217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:43.248192Z","title":"N-player games and mean field games of moderate interactions","venue":null,"work_id":"1ef4c4d4-1047-4eeb-aa27-39f50a232fce","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.587562Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:45111beb2bc199746aa3381a10cd3ad684ddb8e488b48c70c13f8b0ac2bcebaa","observation_id":"97469166-6922-49d8-8dd6-e7e430524278","resolution":{"observed_at":"2026-08-07T13:10:43.356158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.931441Z","title":"Counterfactual multi-agent policy gradients","venue":null,"work_id":"5b25f34d-632d-4039-a8a9-d43c8a642e11","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.719823Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:08aa56ae5852ae800667be871502f0d84031ce0b044f299aab6aae4e95522a5f","observation_id":"023d22f7-2603-4386-8fbe-f1dde2ae9152","resolution":{"observed_at":"2026-08-07T13:10:43.097433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.663288Z","title":"Convergence of adaptive and interacting markov chain monte carlo algorithms","venue":null,"work_id":"46c3de71-c0a4-4119-b907-6b2e7cff3e6f","year":2011},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:17.855496Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:1862b6f6d8d8601833e8fdd1d58552552f89e4fc994a5b98f5934d5e0898bbde","observation_id":"79bbc963-3836-4e96-9a35-0f8520672c3c","resolution":{"observed_at":"2026-08-07T13:10:42.793131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.377653Z","title":"Taming the noise in reinforcement learning via soft updates","venue":null,"work_id":"58a7f176-4e18-4de4-9386-ce7bda675779","year":2016},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.009623Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c5e3e4a8b08c79163d7004759cb3b5b5e456b72f6c881b9dfbeec6e0c1dbcfce","observation_id":"03d71b27-7be9-4f46-a629-b5e3f2106beb","resolution":{"observed_at":"2026-08-07T13:10:42.494859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:18.193450Z","title":"A theory of regularized markov decision processes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.193450Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:3f8b20853c31c983040a2cba66bdfc01614df02535510ac11374e26cbec9f284","observation_id":"b1b27f0a-1f7f-4f2d-9c0f-95401d9ff0e1","resolution":{"observed_at":"2026-08-07T13:10:18.193450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03787","last_updated":"2022-02-16T10:01:00Z","snapshot_observed_at":"2026-08-10T10:46:35.218907Z","submitted_at":"2021-06-07T16:51:07Z","title":"Concave Utility Reinforcement Learning: the Mean-Field Game Viewpoint","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03787","snapshot_observed_at":"2026-08-07T13:10:18.346868Z","title":"Concave utility reinforcement learning: the mean-field game viewpoint, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.346868Z"},"links":{"cited_paper":"/paper/2106.03787","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:532d2987469885679d73fd4066cd0e4c0dc4d0181a01ded5491881c23a0144f9","observation_id":"78fb16c5-db85-4513-951f-93cf8e0bbccb","resolution":{"observed_at":"2026-08-07T13:10:18.346868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:42.162612Z","title":"Numerical resolution of mckean-vlasov fbsdes using neural networks","venue":null,"work_id":"e3822db4-3eb9-4cd1-8d67-6d6d18c52364","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.546112Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:2129bca1600927b6abaa788263958247d3211ac9a77f493eae4f1059b88c7adc","observation_id":"d69e59ea-a95b-4796-8bf2-d7fbc8088ae4","resolution":{"observed_at":"2026-08-07T13:10:42.256776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:18.689464Z","title":"and Diepold, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.689464Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:535dcec45f357fa80f3dbcbf3db4c01fec5e4df12c23977fe7eaeadde48b479a","observation_id":"3a1a6c36-559e-48d7-94c7-a7e450b1a6bf","resolution":{"observed_at":"2026-08-07T13:10:18.689464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:41.845690Z","title":"Learning mean-field games","venue":null,"work_id":"75a4bd87-4397-4c8a-86b6-2940482435a9","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:18.864106Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:a624f43525e3af8956f2bce9ec76d6bb8df46780bcbec6a5c07c3fc9a4c8fa6a","observation_id":"5bfd2c8a-fd34-4a50-ae8f-e06c4b1236c4","resolution":{"observed_at":"2026-08-07T13:10:41.972833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:41.509560Z","title":"A general framework for learning mean-field games","venue":null,"work_id":"2b3c560a-686b-4503-9eba-363166b4398a","year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.028275Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c9438f435c133051e3f23c1e84b0c08ee4b8b83b0afc44386786b988e211520e","observation_id":"ccd5ec80-907a-4e95-8d0e-98e07be6c675","resolution":{"observed_at":"2026-08-07T13:10:41.639343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:41.141974Z","title":"Reinforcement learning with deep energy-based policies","venue":null,"work_id":"50d842a0-1ff3-4615-b362-bf630c7d7b69","year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.165381Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:caa46fb928e34231ad5f2fa1cad816479cf519315aafa5d5c04962ee74697388","observation_id":"e65f3309-8d85-4952-bc78-5a6fae295914","resolution":{"observed_at":"2026-08-07T13:10:41.336299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:40.866478Z","title":"J., Liaw, C., Plan, Y., and Randhawa, S","venue":null,"work_id":"d1d37360-0485-40d0-ab32-df9abecf435c","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.339607Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:145296c32e9f804c075b085f4ef81a661ef738ac6f43b7476a0bb883ed06425d","observation_id":"5b074396-72b5-4276-ba77-c170a92c8aa2","resolution":{"observed_at":"2026-08-07T13:10:40.989906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:19.489673Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.489673Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:88ab2dba44fa399c6d522ea84fbe3f523fcd7a9673020e0f0b81d7e6b4b3c0dd","observation_id":"94f56b99-100a-4721-8c09-56180e6a5ef6","resolution":{"observed_at":"2026-08-07T13:10:19.489673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:40.619823Z","title":null,"venue":null,"work_id":"24469160-ff06-4659-b0f3-10c2d3b40416","year":1972},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.640667Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:e18c648e22df292ba182cf81222eb08d105b02972dd5a144d413f8cf405bb2e4","observation_id":"f8a7b82f-be21-40f2-bce0-cb5781e8892a","resolution":{"observed_at":"2026-08-07T13:10:40.725380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:40.367915Z","title":"E., and Malham \\'e , R","venue":null,"work_id":"2e240b8a-3755-4b38-b943-261248fe5d14","year":2003},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.736199Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:471ed8b80387040bedda95425f22087919b9c508fa15073cef09cf7b32c84cef","observation_id":"0a887376-c623-4d30-a983-83a98eab0cb3","resolution":{"observed_at":"2026-08-07T13:10:40.511051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:40.011666Z","title":"P., and Caines, P","venue":null,"work_id":"fd72539a-3965-4750-a527-5913e8d320f3","year":2005},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:19.880740Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:c3e1a81bb884e12e6769344e4ce465be2ef652d188abee10b1b2d2eeffd801e3","observation_id":"18f08f07-8014-474d-ad13-e41ec9bc9bf9","resolution":{"observed_at":"2026-08-07T13:10:40.194629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:39.723743Z","title":"P., and Caines, P","venue":null,"work_id":"28b326e3-e196-485f-a8cf-fda80495a600","year":2006},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.085274Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:42fcb42556412d534c4653c7337ea838dce85e3c4a446deb51796284691bf913","observation_id":"39a6dc44-f5cd-4cd2-a412-8b19c3e48907","resolution":{"observed_at":"2026-08-07T13:10:39.850916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:39.367003Z","title":"P., and Caines, P","venue":null,"work_id":"81efdb3f-b928-471e-8be8-202091b05539","year":2006},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.238426Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7414c1f60dc667c2ce1bf3a21a72eb72ce6a48355bf7bfc2850c75b463e49372","observation_id":"db69e7c9-770d-46b8-9d34-f9b69d01db74","resolution":{"observed_at":"2026-08-07T13:10:39.591521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:39.101209Z","title":"and Sha, F","venue":null,"work_id":"01def460-7c1c-4b09-87e8-5f0600bd9d8f","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.405360Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:dc2adeb3cc7b8a45f855e33a3676b89e7b1321d507f37657b98d137c599d3097","observation_id":"0868478e-fd85-46bb-9d00-5a1b1ab40a13","resolution":{"observed_at":"2026-08-07T13:10:39.225351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:38.821830Z","title":"and Langford, J","venue":null,"work_id":"0360180d-b1ef-4892-86ba-59e14fd58593","year":2002},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.536988Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:038f54314ab38f6b3e6e47c17291d02e06edcaf9b3cf8caad1eeba89e4bad417","observation_id":"9f637947-4b9e-4903-a1cf-004bc8ed7e5d","resolution":{"observed_at":"2026-08-07T13:10:38.952013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:38.508450Z","title":null,"venue":null,"work_id":"a3cc2e98-31df-4a8c-83b0-ddf7232c9ef7","year":2003},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.673691Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:4c9221c5e6f60a5aef0246e11b930c3bf5bea960e49c196058dd956822cdba18","observation_id":"d2cf9ab8-375c-4972-aa89-067c533187b7","resolution":{"observed_at":"2026-08-07T13:10:38.682202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:38.167709Z","title":"and Singh, S","venue":null,"work_id":"4c762813-f40e-4838-855c-6522929eef80","year":1998},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:20.845556Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:96bcbfe7d626e05effc0c8d4c542deb5491695a82a1d32a1f8bfafdeb0b0e7d2","observation_id":"cbab3140-898f-4cc1-af1f-5adf410ed2c3","resolution":{"observed_at":"2026-08-07T13:10:38.365483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.019331Z","title":"A., and Peters, J","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.019331Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:eec634d4f579e26a6d9c5a9af90f4c29c2a576a22b9cb129bfc670a830d6b135","observation_id":"a733ded7-9ecf-4b7d-a69f-896fc7515207","resolution":{"observed_at":"2026-08-07T13:10:21.019331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:37.871182Z","title":"and Zariphopoulou, T","venue":null,"work_id":"1921dbab-abcd-449c-a322-ba4966c0151b","year":2019},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.140695Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:826d1ac330d75a315a508c759b4c7bfe86859a51f8e01dd2234e1b8902d1c7d1","observation_id":"b216d78f-32db-4a42-9f27-166e20c2548e","resolution":{"observed_at":"2026-08-07T13:10:38.039128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:37.551313Z","title":"and Lions, P.-L","venue":null,"work_id":"5507f896-8246-4207-847a-fca11f385006","year":2006},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.319382Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:5df09320aa10147bb49404139c62a5592fcc16b313b0f8a83388ff30c3a036d0","observation_id":"6137cd43-9af3-45e5-b098-e70a40ca2750","resolution":{"observed_at":"2026-08-07T13:10:37.682067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:37.223065Z","title":"and Lions, P.-L","venue":null,"work_id":"ab9e6917-b048-483e-ab8d-d57cac0cd1cf","year":2006},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.475442Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:df3ac7294b7736cc771267814db9ba3590f139f639955627d113ad00fcba3e61","observation_id":"00e46286-6eca-46ee-98e3-ab074020cf14","resolution":{"observed_at":"2026-08-07T13:10:37.358005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:36.993784Z","title":"and Lions, P.-L","venue":null,"work_id":"76e40b00-9369-4255-9208-646bd54e45f0","year":2007},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.678545Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:734c29566b52afed6cbe7596c80cfb74316ab7b4732de0a126217b12d32e3f36","observation_id":"dc7ff6ff-efdf-4703-ab72-e57f9deb2496","resolution":{"observed_at":"2026-08-07T13:10:37.110259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12944","last_updated":"2024-07-26T18:20:46Z","snapshot_observed_at":"2026-08-08T09:40:53.697167Z","submitted_at":"2022-05-25T17:49:37Z","title":"Learning in Mean Field Games: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12944","snapshot_observed_at":"2026-08-07T13:10:21.805809Z","title":"Learning mean field games: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.805809Z"},"links":{"cited_paper":"/paper/2205.12944","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:74448bf59a5c37a5287c53140dae82196b92f6f3f6c19fa5009118a410830c9c","observation_id":"df7cf107-2d2d-46dd-ad91-acc63b4c49c2","resolution":{"observed_at":"2026-08-07T13:10:21.805809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:21.939715Z","title":"and Tankov, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:21.939715Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:5d15fbdd47a4fbc38863a5872cf5850d4a7921c4e43034374b3787e2fabb7ce3","observation_id":"caa7464b-ca39-4d2a-b1a3-52c81f97e0b2","resolution":{"observed_at":"2026-08-07T13:10:21.939715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:36.638116Z","title":"G., and Castro, P","venue":null,"work_id":"4ce83f62-fd7c-40c4-a389-dd14cfcaa56b","year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.118395Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f216f6833fe6222837405718d9fd1cd929dcae1d146375664c34cb7a4853d80a","observation_id":"b4ef1a75-91d8-4d15-95cf-65c2afa50d05","resolution":{"observed_at":"2026-08-07T13:10:36.778709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:36.389648Z","title":"A mean-field game approach to cloud resource management with function approximation","venue":null,"work_id":"200ce5df-9814-4909-98b6-a2a6793df166","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.294882Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:2f0f86903eb133d9ab5a4692576cff48ab3d80d3477f294dc41776012e4802b1","observation_id":"061924ee-e8d9-42d4-a570-edba6260118a","resolution":{"observed_at":"2026-08-07T13:10:36.518742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:36.082477Z","title":"I., Fern \\'a ndez-Gaucherand, E., Hern \\'a ndez-Hernandez, D., Coraluppi, S., and Fard, P","venue":null,"work_id":"46ea1e4d-5207-4cfa-9d36-ba14513527da","year":1997},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.422162Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:a90914dcf3e9908c6fc139876556792c20088afe84100434a8ab452ade8032ed","observation_id":"e4d9343c-f81b-4127-ac4e-b3612d920a9b","resolution":{"observed_at":"2026-08-07T13:10:36.242074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:35.807947Z","title":"J., and Le Fort-Piat, N","venue":null,"work_id":"e11505d0-e594-4661-8bf0-0013041b1a05","year":2007},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.542113Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:2fa6733e2180081c53ee1b2fe4cb2432b4db41d2fdb6befea1af406b84553cc5","observation_id":"62b0348e-6afa-4d28-a1a0-b1e1d296efc5","resolution":{"observed_at":"2026-08-07T13:10:35.938947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:35.542726Z","title":"On the global convergence rates of softmax policy gradient methods","venue":null,"work_id":"62395432-3bd2-4ba8-ac9d-4a57a7a24af0","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.629063Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7388324d2befa204ce0de57b144f7780cf24c099dab72ae80636cc9d567a6aa8","observation_id":"c2192078-c026-4f09-9341-aeb0ddfb1cd0","resolution":{"observed_at":"2026-08-07T13:10:35.674906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:35.213275Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"962c360c-0ce0-4279-8bf4-387ab5992f9c","year":1928},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.697117Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:47b362d2fb14e9f6fb68ca5f83763825d587ca0860034457eca7c31b0c8b8631","observation_id":"179377ee-779a-40c0-adfe-684e4f89a49c","resolution":{"observed_at":"2026-08-07T13:10:35.407930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:34.796694Z","title":"Equilibrium points in n-person games","venue":null,"work_id":"aad04bde-6e38-4e2c-8ae6-5e658e038941","year":1950},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.825724Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:03fbafc6a8b28b4ea5fc9a15ca35781be6b239eda9a620b989c1178c060b847d","observation_id":"deee8e41-6131-4519-83d0-0d81307edf98","resolution":{"observed_at":"2026-08-07T13:10:35.017098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:34.478062Z","title":"Non-cooperative games","venue":null,"work_id":"bf051be7-e944-43bf-a97d-a3f37e9f34d6","year":1951},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:22.945284Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:d362975c87d79a57f5cbe4ce154fdfd997bedcbe925b1df3cb55a4eb2ca04724","observation_id":"9459171a-5cd1-4b5f-a64c-ace63906c4e2","resolution":{"observed_at":"2026-08-07T13:10:34.652398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-07T13:10:23.087809Z","title":"A unified view of entropy-regularized markov decision processes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.087809Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:863e7d44ca37cfde6debf00d86ca49855aa635d00e67674cffdc285f7466e0cf","observation_id":"8797b717-c186-4857-a0cb-d49e42ae35a9","resolution":{"observed_at":"2026-08-07T13:10:23.087809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:34.097888Z","title":"Combining policy gradient and q-learning","venue":null,"work_id":"68ce6767-9aed-4baf-9c90-a070ab114ac9","year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.258768Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:eaaf947c2a9741fe8113ef06aee767b4d04045d0721d4d93598885f80223eef1","observation_id":"d45e711e-b08b-4bf2-b8aa-78fad369ea65","resolution":{"observed_at":"2026-08-07T13:10:34.305505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.834643Z","title":"Scaling mean field games by online mirror descent","venue":null,"work_id":"75a45bc7-fd56-4e72-b69f-b1a9de876376","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.407117Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f12c00eee97dad32428044ca1d8c6860606e84be35de47a4e8072f108b768269","observation_id":"6a6656f1-46f9-4cf2-a0f6-3db7528d17c0","resolution":{"observed_at":"2026-08-07T13:10:33.964017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.536360Z","title":"Fictitious play for mean field games: C ontinuous time analysis and applications","venue":null,"work_id":"55d40987-b47d-4725-bb09-220ce743fe7c","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.669181Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:55b6f554bc27f4036dc1e91ed70f5127c2471061158e180277afd0fe6ecc9e52","observation_id":"d341e81a-6d43-4e45-9261-cf9318c72e8f","resolution":{"observed_at":"2026-08-07T13:10:33.667286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.07933","last_updated":"2021-05-17T15:17:36Z","snapshot_observed_at":"2026-07-06T11:10:07.425725Z","submitted_at":"2021-05-17T15:17:36Z","title":"Mean Field Games Flock! The Reinforcement Learning Way","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.07933","snapshot_observed_at":"2026-08-07T13:10:23.894935Z","title":"Mean field games flock! the reinforcement learning way","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:23.894935Z"},"links":{"cited_paper":"/paper/2105.07933","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:426d64c687f0970cc122bc4c9f44e31c9e8371990ec76c32635460ff8616a152","observation_id":"9804e0d7-ba49-4ec8-b59b-1efd1be482c1","resolution":{"observed_at":"2026-08-07T13:10:23.894935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.282444Z","title":"Generalization in mean field games by learning master policies","venue":null,"work_id":"7033d0ed-9477-4360-9881-f6f3cb09ad27","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.088295Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:779c4301ba4f318d0bfdda3d2bf1cd91c10cfb4575c4051faab17ce8649c0ff2","observation_id":"ed45f950-7f0f-4a09-9c65-7cf997065bfc","resolution":{"observed_at":"2026-08-07T13:10:33.421759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:33.080308Z","title":"Relative entropy policy search","venue":null,"work_id":"0fc41264-d54f-41b3-ad06-18d364ed6492","year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.280777Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f4f266b4e2a3eef20ac601849b6cb232fcdee93a33b351da7c1abcf8dea130ea","observation_id":"6f072f44-c0b5-4a69-907c-fc5f15848068","resolution":{"observed_at":"2026-08-07T13:10:33.137548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.861828Z","title":null,"venue":null,"work_id":"8a1816a7-1160-4549-83aa-53ff751cfb00","year":1978},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.415989Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:24fcee4580fe821b58dba9181e99cdb6816ca87f526983d80b9d991fca4bff12","observation_id":"a6d8c63e-2826-4cb1-8ef4-c27bdf46da08","resolution":{"observed_at":"2026-08-07T13:10:32.954863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.715470Z","title":"Risk-averse dynamic programming for markov decision processes","venue":null,"work_id":"3e9eb590-37f3-4a43-9032-edb6600f2059","year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.501979Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:23bb3e029585944774ed8ca84cf639e8c9ddcddb843d126c730577a3ba2e6516","observation_id":"b27f4cb1-4c6d-4247-9f29-14222d27e36e","resolution":{"observed_at":"2026-08-07T13:10:32.785228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.435150Z","title":"Discrete-time average-cost mean-field games on polish spaces","venue":null,"work_id":"afd93a53-a98e-4994-b6f5-efae8b2f2e4e","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.662129Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:ce623571281859ce9aa34d6015d0d66bfe08a0b3629974f93528ce3aa630a00f","observation_id":"78eb7089-8b69-4d91-8dea-1905199a3f2a","resolution":{"observed_at":"2026-08-07T13:10:32.563548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04043","last_updated":"2019-12-09T07:26:52Z","snapshot_observed_at":"2026-08-10T01:55:31.555267Z","submitted_at":"2019-02-11T18:43:53Z","title":"The StarCraft Multi-Agent Challenge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.04043","snapshot_observed_at":"2026-08-07T13:10:24.777756Z","title":"S., Farquhar, G., Nardelli, N., Rudner, T","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.777756Z"},"links":{"cited_paper":"/paper/1902.04043","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:9c98e7d4097b463618ffce0052910f5f1516eecb23d2f740b88224b2710c389c","observation_id":"a06817dc-94c0-40e9-b3b1-aced4a8a7c3e","resolution":{"observed_at":"2026-08-07T13:10:24.777756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:32.172367Z","title":"and Geist, M","venue":null,"work_id":"343aa147-7793-46f7-afb7-86b2a283bc8d","year":2014},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:24.904569Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:4c9b70258c0cd9db13f2062d090ff2832f0cd1260ba6a1c0019859cf798c64f8","observation_id":"27eef3f0-dde0-4a7e-9fbb-adfc6193a832","resolution":{"observed_at":"2026-08-07T13:10:32.297226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.937616Z","title":"Trust region policy optimization","venue":null,"work_id":"fbbf79ca-19d0-4821-8dc6-dfdc457c3875","year":2015},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.085428Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:8de95c7251b723382c4439f6c063c51ecacdb13eb8daba58b6f9f016b99c93a3","observation_id":"17cde2f0-fc39-4990-83b9-63c2af12ed7f","resolution":{"observed_at":"2026-08-07T13:10:32.042431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.03295","last_updated":"2016-10-11T12:09:03Z","snapshot_observed_at":"2026-08-03T05:49:14.071341Z","submitted_at":"2016-10-11T12:09:03Z","title":"Safe, Multi-Agent, Reinforcement Learning for Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.03295","snapshot_observed_at":"2026-08-07T13:10:25.197393Z","title":"Safe, multi-agent, reinforcement learning for autonomous driving","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.197393Z"},"links":{"cited_paper":"/paper/1610.03295","citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:63e5dcddb926a9df6ba7f9055f633bdc3ea8250e3bd41f3b417c7c2d71ee247b","observation_id":"e163f9de-fd01-4a78-be95-55c051baff8d","resolution":{"observed_at":"2026-08-07T13:10:25.197393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.692343Z","title":"Adaptive trust region policy optimization: Global convergence and faster rates for regularized mdps","venue":null,"work_id":"94f98816-89a2-44d3-abdd-7ec2afef1061","year":2020},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.356684Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:e95463fb3586a3501cbf7b16f74aecbd7af0831722c49048210adaa87ab6ca0b","observation_id":"62a70fbc-ee7d-4dfb-82e9-fedcc03f6342","resolution":{"observed_at":"2026-08-07T13:10:31.863235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.429244Z","title":"Near-optimal time and sample complexities for solving markov decision processes with a generative model","venue":null,"work_id":"1632576e-a62e-4778-a0f0-9a87fd907d7b","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.492393Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:e821225611537727ccba3e1b2d458f527296865b9b0bd50b4a255a0da596f175","observation_id":"c61aa626-fc8a-479d-9489-b171f6d3fac2","resolution":{"observed_at":"2026-08-07T13:10:31.502983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.239621Z","title":"and Barto, A","venue":null,"work_id":"4a50f7c2-8d02-43df-8f15-98d020adaaaa","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.663184Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:45aedda779fd078b226a7a394f94fe9e415e6220f21816bb8eed7196ef83f37f","observation_id":"c285cf1f-31d3-422b-9690-aae4aa618c9a","resolution":{"observed_at":"2026-08-07T13:10:31.332007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:31.027052Z","title":null,"venue":null,"work_id":"77b2806d-c4a3-406d-b7b7-ad05fac7c5b4","year":2018},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.789076Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:39f3ec2fb7d10bca228867649651a58ef333faa64cd9706bd5fbd8d3ff66ec57","observation_id":"bd5dc256-aa0c-4404-8f4f-3f0e0ae72acd","resolution":{"observed_at":"2026-08-07T13:10:31.146473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.733199Z","title":"Algorithms for reinforcement learning","venue":null,"work_id":"fdd74397-edb1-499c-bf5e-3a36d08847d0","year":2022},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:25.976783Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:5c827e29ea0120848589961320a151b450595d1a883a9f8978b1667f50433862","observation_id":"8f602fc9-608c-4b01-8d32-15962ae3e3ba","resolution":{"observed_at":"2026-08-07T13:10:30.866770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.514628Z","title":"and Zhou, X","venue":null,"work_id":"2842e59a-cda6-4b3f-8777-e3c23af16c96","year":2024},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.108732Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:e8653e92d0820aa6fbd6b99887d81b55f252d3beb81d4b1fb4c36d16811ae4d2","observation_id":"d97a3575-cbc2-4494-a256-039da6b3be71","resolution":{"observed_at":"2026-08-07T13:10:30.584759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:30.169898Z","title":"Deep learning-based numerical methods for high-dimensional parabolic partial differential equations and backward stochastic differential equations","venue":null,"work_id":"f46af003-4058-45e0-aace-7c145b3a398b","year":2017},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.241320Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:65200078f776e45feddff8629a278ec8bac85a28671f3e027f0fb05b6f478039","observation_id":"d23c640d-f2cb-4332-a07e-46bc412993b2","resolution":{"observed_at":"2026-08-07T13:10:30.349052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.881151Z","title":null,"venue":null,"work_id":"c9c1ce03-5270-4070-ac3b-7c34b08b0c99","year":2000},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.416453Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7b2143ad92e24602b77f12178a74c87464c15aab919eb289cc522f02e179f5e7","observation_id":"14ce55e6-3de5-4025-be1d-644c4611101b","resolution":{"observed_at":"2026-08-07T13:10:29.996593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.540877Z","title":null,"venue":null,"work_id":"c3fbaf7a-602f-4308-b909-9bbc7d8d9cab","year":1991},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.554078Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:413b172355b7f3702be46a3435b5b5560115706d9ddd336038ff0c83a7140867","observation_id":"c4948045-4cdc-45ec-9ad2-856d0e229c0e","resolution":{"observed_at":"2026-08-07T13:10:29.720378Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.260065Z","title":"Policy mirror ascent for efficient and independent learning in mean field games","venue":null,"work_id":"35e89a22-0686-4561-9033-3e7965f7117b","year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:26.764903Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:f15b8cd9d0d147a38121e5e4573ef79d749b1382070774fbbc4024d835e6ad13","observation_id":"97283845-d13d-4399-bf3c-36ce0d4ffa19","resolution":{"observed_at":"2026-08-07T13:10:29.386478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:29.128253Z","title":null,"venue":null,"work_id":"5e771a5d-3fc2-4e8f-908f-f3edb8bafe00","year":2023},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.017211Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:7577877e6ad0badc39fb300d53cc85ad9fe3dd3cc1af965677ee11502dd522fc","observation_id":"e4890fa3-9eba-4808-83e8-edca356f2b54","resolution":{"observed_at":"2026-08-07T13:10:29.189716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.893949Z","title":"Multi-agent reinforcement learning: A selective overview of theories and algorithms","venue":null,"work_id":"ceda253c-c6da-4aad-adf8-3c198f8fecc2","year":2021},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.275330Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:35bf27c335a7fd96ba1ac12c14ce36909ba68aee758527de421f2fae46bcecf4","observation_id":"83382493-16e4-41c4-bcf8-b5ca657e6f61","resolution":{"observed_at":"2026-08-07T13:10:29.016638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.440566Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.440566Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:e94241cdd0c1bc26014885b85c41b3c34e6161d6d0d92500c47b4968bca14aee","observation_id":"a2658e27-0b40-4d5f-b58c-a51f579f4b39","resolution":{"observed_at":"2026-08-07T13:10:27.440566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:28.759003Z","title":"D., Bagnell, J","venue":null,"work_id":"092c3550-8225-46cc-8738-2dff81773637","year":2010},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.525688Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:9e63e4f0617141095cb1a9be1d1cda7a2e2d159b53d92349875c63e8fc3aeb45","observation_id":"010bacfd-047a-4a62-9ea7-646781f58239","resolution":{"observed_at":"2026-08-07T13:10:28.811262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:10:27.705945Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-07T13:10:27.705945Z"},"links":{"citing_paper":"/paper/2505.22781"},"observation_digest":"sha256:e6fff4d539f5c1cde571261143f91e553754a91b4a248433a4a5f78cf21e09fa","observation_id":"26a31921-354f-45b5-b123-62d2532794ca","resolution":{"observed_at":"2026-08-07T13:10:27.705945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22781","last_updated":"2025-05-28T18:50:25Z","latest_version":1,"primary_category":"stat.ML","snapshot_observed_at":"2026-08-10T01:56:03.351457Z","submitted_at":"2025-05-28T18:50:25Z","title":"Finite-Sample Convergence Bounds for Trust Region Policy Optimization in Mean-Field Games"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":54},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 1 inbound Pith citation observation for arXiv:2505.22781."}