{"as_of":"2026-08-17T17:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26d09176a7363717f547544ed30d44d57d8d326d5f44f7f94b69c5a4093aee25","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:47:05.795761Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:19:53.934535Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T06:56:44.503712Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.00663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00663","snapshot_observed_at":"2026-07-02T06:56:44.503712Z","title":"arXiv preprint arXiv:2505.00663v1 , year=","venue":null,"work_id":"7341d663-31ef-4297-bce9-869ffb398d6f","year":2025},"citing_paper":{"arxiv_id":"2603.25777","last_updated":"2026-05-11T10:04:05Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T13:15:37Z","title":"Challenges and opportunities for AI to help deliver fusion energy","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T00:39:46.244035Z"},"links":{"cited_paper":"/paper/2505.00663","citing_paper":"/paper/2603.25777"},"observation_digest":"sha256:13ae4f7b030b0fe7af363533ff36a05b5299af365af849a49e240cafa29ed00f","observation_id":"ac0cc622-9671-4b93-b2be-8695092a6a38","resolution":{"observed_at":"2026-05-15T00:43:25.441685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.00663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00663","snapshot_observed_at":"2026-07-02T06:56:44.503712Z","title":"arXiv preprint arXiv:2505.00663v1 , year=","venue":null,"work_id":"7341d663-31ef-4297-bce9-869ffb398d6f","year":2025},"citing_paper":{"arxiv_id":"2605.22622","last_updated":"2026-05-21T15:32:39Z","snapshot_observed_at":"2026-07-06T23:32:54.127514Z","submitted_at":"2026-05-21T15:32:39Z","title":"A note on convergence of Wasserstein policy optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-22T06:36:57.345741Z"},"links":{"cited_paper":"/paper/2505.00663","citing_paper":"/paper/2605.22622"},"observation_digest":"sha256:560e7a1cea2ca2af35d872e486c17b64352cfd0903f4dc1d664666ad7c67e2de","observation_id":"d42fbe4a-6cef-4066-bedb-7edae218c41c","resolution":{"observed_at":"2026-05-22T06:41:10.858631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.00663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00663","snapshot_observed_at":"2026-07-02T06:56:44.503712Z","title":"arXiv preprint arXiv:2505.00663v1 , year=","venue":null,"work_id":"7341d663-31ef-4297-bce9-869ffb398d6f","year":2025},"citing_paper":{"arxiv_id":"2605.26078","last_updated":"2026-06-08T11:31:14Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T17:42:59Z","title":"Global Convergence of Wasserstein Policy Gradient for Entropy-Regularized Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:19:53.934535Z"},"links":{"cited_paper":"/paper/2505.00663","citing_paper":"/paper/2605.26078"},"observation_digest":"sha256:65bb852249fe713b296b20b443cb313ef5db5d3bffa90665a4347d9c8a1ac2f0","observation_id":"5238f7d7-76f5-44de-b82b-131b8f3d9832","resolution":{"observed_at":"2026-06-29T22:24:00.339861Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.00663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00663","snapshot_observed_at":"2026-07-02T06:56:44.503712Z","title":"arXiv preprint arXiv:2505.00663v1 , year=","venue":null,"work_id":"7341d663-31ef-4297-bce9-869ffb398d6f","year":2025},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-06T13:00:03.980604Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/2505.00663","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:63dbc68a623cb21f41dc303ce522cc78ca6241623cf9c7a8cb1b8daf01b5ddae","observation_id":"42fb7b7b-e288-4bc2-a5d4-6af7262093e9","resolution":{"observed_at":"2026-06-29T19:53:55.983387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"cited_work":{"arxiv_id":"2505.00663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00663","snapshot_observed_at":"2026-07-02T06:56:44.503712Z","title":"arXiv preprint arXiv:2505.00663v1 , year=","venue":null,"work_id":"7341d663-31ef-4297-bce9-869ffb398d6f","year":2025},"citing_paper":{"arxiv_id":"2606.04335","last_updated":"2026-06-04T10:50:34Z","snapshot_observed_at":"2026-08-16T06:15:50.664859Z","submitted_at":"2026-06-03T01:25:20Z","title":"Policy Gradient for Continuous-Time Robust Markov Decision Processes","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T07:18:48.673738Z"},"links":{"cited_paper":"/paper/2505.00663","citing_paper":"/paper/2606.04335"},"observation_digest":"sha256:830aea477db5aa03d502685136e4098f0bc6bfb841c2d23732ef72094f911357","observation_id":"2aca0c6c-ab04-45a0-9c52-c2ef9587a81b","resolution":{"observed_at":"2026-07-02T06:56:44.505465Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00663/citation-record","integrity":"/paper/2505.00663/integrity","json":"/paper/2505.00663/citation-record.json","paper":"/paper/2505.00663"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.588081Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.588081Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:31a5807d450a294e3ebe39c379c571808823316ae38967fe64ea559e6549d55e","observation_id":"b5b7dfde-d8ef-4053-a00f-f73925c912b2","resolution":{"observed_at":"2026-08-16T04:47:05.588081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.327729Z","title":"T., Tassa, Y., Munos, R., Heess, N., and Riedmiller, M","venue":null,"work_id":"a22324c7-62db-4e6b-9b42-08818d86ceb6","year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.593154Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:7be0dad50c4df7ebe1a9f09e0921ddd1b57faa3572e63cb1c358fe3b3efd71c9","observation_id":"2254d3da-e420-4c79-b6aa-9e78c980eec9","resolution":{"observed_at":"2026-08-16T04:47:06.331926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.13196","last_updated":"2019-09-16T22:43:14Z","snapshot_observed_at":"2026-08-17T13:05:45.528997Z","submitted_at":"2019-07-30T19:42:52Z","title":"Wasserstein Robust Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.13196","snapshot_observed_at":"2026-08-16T04:47:05.597189Z","title":"A., Ren, H., Ammar, H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.597189Z"},"links":{"cited_paper":"/paper/1907.13196","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:47f6b4e89330b66d1caf2db2c22f8d2b62b821bce0eaecba1a46033cf2804893","observation_id":"5ab9bc6b-cab4-4dbc-b48b-8645b4b1b909","resolution":{"observed_at":"2026-08-16T04:47:05.597189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.601296Z","title":"M., Lee, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.601296Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:e33c75c873c4099bcf4c0928328eb11f32bfa741bc9052571ec4fea277084fdb","observation_id":"733ba229-d450-4089-88ae-ba561c450cbc","resolution":{"observed_at":"2026-08-16T04:47:05.601296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.604877Z","title":"Gradient flows: in metric spaces and in the space of probability measures","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.604877Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:2592f9e0b78e998c4ec66a45937c6fa441c5b817f1c7532351eab79601a10be2","observation_id":"d34dd838-1579-4ca8-aba0-b935f4832c21","resolution":{"observed_at":"2026-08-16T04:47:05.604877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.302324Z","title":"W., Budden, D., Dabney, W., Horgan, D., Tb, D., Muldal, A., Heess, N., and Lillicrap, T","venue":null,"work_id":"b3edb525-45c7-4269-b31e-6cb5ab609a49","year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.608466Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:c0a7d6db123455eb2ff84ac1910925df319292db9512b9c237d5e05c47896dbe","observation_id":"56df3e18-0b0e-4184-b5d8-f649980ff82f","resolution":{"observed_at":"2026-08-16T04:47:06.306496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.291225Z","title":"G., Sutton, R","venue":null,"work_id":"4cb07906-8fdc-4b7b-aae2-252e3142c916","year":1983},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.612357Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:245c32b18fc89df4adcda12039537849f666264fd4356ddbf2ac7597589256df","observation_id":"41dad690-926f-4135-b459-184cc07b59cb","resolution":{"observed_at":"2026-08-16T04:47:06.294957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.280049Z","title":"G., Dabney, W., and Munos, R","venue":null,"work_id":"c621e852-e3eb-4e71-8e88-501795fe0a08","year":2017},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.616220Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:f243774398e468b0a10f8d89bb01b168397c061c92bee3d4318841ce68d75249","observation_id":"c109af0b-e5a3-41d2-a497-fa0e246179c5","resolution":{"observed_at":"2026-08-16T04:47:06.283686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.619989Z","title":"and Brenier, Y","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.619989Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:fbf64cfaa309176d700844a8d0dcecb20bb836484b9ba14dad5acdbfe5de40e9","observation_id":"9662de86-3d7e-48cc-930a-e1e12a352561","resolution":{"observed_at":"2026-08-16T04:47:05.619989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.262739Z","title":"Development of free-boundary equilibrium and transport solvers for simulation and real-time interpretation of tokamak experiments","venue":null,"work_id":"78472b23-03eb-4a10-b3b3-c4ee62226c5d","year":2021},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.624192Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:b63b7711aae143b29907fcfe15cca7f3023adf8cdfbb6227fb8a0b6ed1db5982","observation_id":"d8ac57cd-5b35-4274-82fb-516c7af50691","resolution":{"observed_at":"2026-08-16T04:47:06.266647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08229","last_updated":"2022-01-21T19:53:11Z","snapshot_observed_at":"2026-08-16T18:19:56.576070Z","submitted_at":"2021-06-03T14:24:12Z","title":"MICo: Improved representations via sampling-based state similarity for Markov decision processes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08229","snapshot_observed_at":"2026-08-16T04:47:05.628603Z","title":"S., Kastner, T., Panangaden, P., and Rowland, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.628603Z"},"links":{"cited_paper":"/paper/2106.08229","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:1a8a471bcc8d01a2eeb4c756429b47d650a89834f0a8d56c8856a4635fd2e41a","observation_id":"59307d2d-0cea-46e5-806f-be758d7ddaf0","resolution":{"observed_at":"2026-08-16T04:47:05.628603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.634035Z","title":"T., Rubanova, Y., Bettencourt, J., and Duvenaud, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.634035Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:c44f678c499b130932557cb65bbd971bcfe28cec98df05e7c092c90371ad787f","observation_id":"5b4cddc1-b794-4c27-9d69-bffcd7d184c8","resolution":{"observed_at":"2026-08-16T04:47:05.634035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.244915Z","title":"Fast and accurate deep network learning by exponential linear units (elus)","venue":null,"work_id":"e285d7b9-b10f-430e-bf0d-29003be980f8","year":2015},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.638728Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:fda1d683d0c0ce358406fe5e169c4b854a1bbaee1a074261096afe65c6be5580","observation_id":"c38ecf22-afac-4732-8aba-d3fcf077b551","resolution":{"observed_at":"2026-08-16T04:47:06.248832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.642253Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.642253Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:075cbb264fd4aa4cbd65577309863240a5e4528bb106ba51a16188d2c6b55544","observation_id":"6f464a34-6fdf-406c-87b2-0e9a0a2d4222","resolution":{"observed_at":"2026-08-16T04:47:05.642253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.645704Z","title":"Experimental research on the TCV tokamak","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.645704Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:86a9edf1fbbb221bf55f49e92131592766907ddc6da2dae679e7d05a5fdddef9","observation_id":"0495d737-0898-4b96-bce4-c7eec5c1cbae","resolution":{"observed_at":"2026-08-16T04:47:05.645704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.649683Z","title":"Sigmoid-weighted linear units for neural network function approximation in reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.649683Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:0a8a8a51224101013f60914d98d020b445806b2dac0ac3ba630f658ea366c84c","observation_id":"3a3fc4cf-9920-41a2-b044-ee578f2224fb","resolution":{"observed_at":"2026-08-16T04:47:05.649683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23810","last_updated":"2024-10-31T10:52:42Z","snapshot_observed_at":"2026-08-16T13:04:12.760238Z","submitted_at":"2024-10-31T10:52:42Z","title":"CALE: Continuous Arcade Learning Environment","version":1},"cited_work":{"arxiv_id":"2410.23810","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23810","snapshot_observed_at":"2026-08-16T04:47:05.931954Z","title":"CALE: Continuous Arcade Learning Environment","venue":"cs.LG","work_id":"ef02dcfc-668b-441a-a020-5b0ce091efe8","year":2024},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.653202Z"},"links":{"cited_paper":"/paper/2410.23810","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:564009eeecddb5ee4d60490eb411cd1f01b39115cabe577e7f2d2518b686c224","observation_id":"2ec59336-bd68-4aaf-a304-ee1b46abba65","resolution":{"observed_at":"2026-08-16T04:47:05.935740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.218594Z","title":"Metrics for finite markov decision processes","venue":null,"work_id":"86d3897e-b561-44ac-bd4a-79dc331c2af3","year":2004},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.657534Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:5590918ce3f7449bfd4e3aed718e769c2da0f4f07f6b89b194ceda7fe6a7fa14","observation_id":"b7d4ecf8-0e0e-4cbb-b112-33cb32583843","resolution":{"observed_at":"2026-08-16T04:47:06.222698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.661528Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.661528Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:cd61898c496cf1963df534e2746e52023acf474a4d576e3a2300f9107143aae0","observation_id":"6335febe-a02a-473e-9ae8-dedb8a0a42fe","resolution":{"observed_at":"2026-08-16T04:47:05.661528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.198330Z","title":"H., Tirumala, D., Humplik, J., Wulfmeier, M., Tunyasuvunakool, S., Siegel, N","venue":null,"work_id":"49fd6db3-eacb-461b-b939-4b7cb8418302","year":2024},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.666603Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:fc4ff6f46c49ad785c99ec818631cc2731408a45557fe0fc8bd961a64e3421de","observation_id":"27536610-f19e-42b6-8a56-2f38f5d39127","resolution":{"observed_at":"2026-08-16T04:47:06.202530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07940","last_updated":"2021-10-15T08:41:51Z","snapshot_observed_at":"2026-08-16T17:49:05.199907Z","submitted_at":"2021-10-15T08:41:51Z","title":"Wasserstein Unsupervised Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2110.07940","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.07940","snapshot_observed_at":"2026-08-16T04:47:05.918689Z","title":"Wasserstein Unsupervised Reinforcement Learning","venue":"cs.LG","work_id":"c6cb7bd7-5ab4-47a3-b1c0-2a74ca3c8403","year":2021},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.670497Z"},"links":{"cited_paper":"/paper/2110.07940","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:813393542c28d0caa7205c8032341a80d3bdbda3c8934f369a87f05c75691ee4","observation_id":"857f1670-9d4e-432b-99e7-5be13481fc37","resolution":{"observed_at":"2026-08-16T04:47:05.922391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.187510Z","title":"Learning continuous control policies by stochastic value gradients","venue":null,"work_id":"3311a326-b4e9-4620-ab0f-736d937adcc2","year":2015},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.674549Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:7e80b23610e34c3df0ab498d88698e2aa8690b2e358abf67aedc4db1265e8624","observation_id":"744ec0f7-4171-4892-9043-dd086adef2b2","resolution":{"observed_at":"2026-08-16T04:47:06.191434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.00979","last_updated":"2022-09-20T17:15:51Z","snapshot_observed_at":"2026-08-16T22:28:38.126956Z","submitted_at":"2020-06-01T14:38:52Z","title":"Acme: A Research Framework for Distributed Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.00979","snapshot_observed_at":"2026-08-16T04:47:05.678159Z","title":"W., Shahriari, B., Aslanides, J., Barth-Maron, G., Momchev, N., Sinopalnikov, D., Sta \\'n czyk, P., Ramos, S., Raichuk, A., Vincent, D., et al","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.678159Z"},"links":{"cited_paper":"/paper/2006.00979","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:0aa69bb002d832b4569654f08c0e9fb81b723ef4f4c68ef5a6435c92b74cc93c","observation_id":"2fd903b9-9f74-4b6a-b4c6-bf191014cea0","resolution":{"observed_at":"2026-08-16T04:47:05.678159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.172924Z","title":null,"venue":null,"work_id":"cb4707fd-6a47-49f4-9af8-d54933536b24","year":1960},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.683628Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:ffa7578fa5e0eced01aa0552ee5229adedfa7b229adc562edd9667d05efb3f0b","observation_id":"0395637c-0a5c-4c90-9a66-d09ac040974d","resolution":{"observed_at":"2026-08-16T04:47:06.177293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.161648Z","title":null,"venue":null,"work_id":"b59141ff-4c11-419a-bae8-d73c9a10eb2f","year":2023},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.689320Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:40861427b03bd3a6e59ee69efe1076290710e4acb4051e6ecd95e643eb1cc1af","observation_id":"45aaa500-a603-4a85-a431-74aea021f4e5","resolution":{"observed_at":"2026-08-16T04:47:06.165323Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.150445Z","title":"Categorical reparameterization with G umbel-softmax","venue":null,"work_id":"e095787b-2491-4239-93b4-bf65fed4aa2a","year":2017},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.694063Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:745efa15f2ddd2417a60ea77914acffc99990db2bd35194957012c6f3ab301fa","observation_id":"b48467e3-ffd7-45c6-a333-91bda38df65b","resolution":{"observed_at":"2026-08-16T04:47:06.154538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.138435Z","title":null,"venue":null,"work_id":"55736077-6222-4552-b55e-734050e293ee","year":2001},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.698562Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:1c7d61b1688bb536ecb903134e7af6dce4007c9e207ddcb7cecba17733db987e","observation_id":"acc2e2a9-bed6-428e-bb47-9446929ffd68","resolution":{"observed_at":"2026-08-16T04:47:06.142634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02378","last_updated":"2023-03-04T10:52:20Z","snapshot_observed_at":"2026-08-16T15:50:50.822558Z","submitted_at":"2023-03-04T10:52:20Z","title":"Wasserstein Actor-Critic: Directed Exploration via Optimism for Continuous-Actions Control","version":1},"cited_work":{"arxiv_id":"2303.02378","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.02378","snapshot_observed_at":"2026-08-16T04:47:05.892185Z","title":"Wasserstein Actor-Critic: Directed Exploration via Optimism for Continuous-Actions Control","venue":"cs.LG","work_id":"1b810cce-9a1a-49d8-a534-82dd5a512e8b","year":2023},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.702822Z"},"links":{"cited_paper":"/paper/2303.02378","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:87458475c05cff97636848ae96a3928c20ea32fbc6176f00ceb2bec65c6005db","observation_id":"51a4ad7c-dfc5-4b11-af34-2432dd3181ce","resolution":{"observed_at":"2026-08-16T04:47:05.898230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-16T22:06:26.835611Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-16T04:47:05.706926Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.706926Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:36c60ae5ec13ccf5d37e10c96c985be3c42a84b00b8b5767f94013488a4f8eac","observation_id":"683d7e2a-d004-4fca-a499-b7fcbeebd1f1","resolution":{"observed_at":"2026-08-16T04:47:05.706926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.126188Z","title":"J., Mnih, A., and Teh, Y","venue":null,"work_id":"1f6fd1d4-7ed5-40b5-a860-423902c1ef10","year":2017},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.711300Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:0a2d35d46199a09d62c2cb1e1a9993408905f59e5af30d99737760470a33fc87","observation_id":"fa09afc5-6421-442b-89e4-cf543840fdda","resolution":{"observed_at":"2026-08-16T04:47:06.130226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.114381Z","title":"and Grosse, R","venue":null,"work_id":"5285a71c-9e09-4383-ad8e-cd6a750868f9","year":2015},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.715064Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:fcb0ece7f1ba3fd56209e413c080aae7c2b435074f526884e4d18cb0f462285d","observation_id":"9850b65c-b8ab-4482-8108-b8e4a356824a","resolution":{"observed_at":"2026-08-16T04:47:06.118288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.102219Z","title":"M., Likmeta, A., and Restelli, M","venue":null,"work_id":"66c113cd-29fb-4d0c-8ce2-c61f85e4d29a","year":2019},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.718976Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:881a60af22ed839578ffe21b97285d68c60f05eb785106b0a475d6a9525c1059","observation_id":"ac03dda1-012e-4034-95eb-2c6f0a8b5bb0","resolution":{"observed_at":"2026-08-16T04:47:06.105754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05380","last_updated":"2021-03-18T10:41:34Z","snapshot_observed_at":"2026-08-16T19:14:18.631853Z","submitted_at":"2020-10-12T00:50:17Z","title":"Efficient Wasserstein Natural Gradients for Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05380","snapshot_observed_at":"2026-08-16T04:47:05.722747Z","title":"Efficient W asserstein natural gradients for reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.722747Z"},"links":{"cited_paper":"/paper/2010.05380","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:2a57a2b68700fb4a9c535483eee68b6c300fbc3d1307d43e547bfa4ea67ba491","observation_id":"e144be77-e467-494d-945b-4a65c3f7f94a","resolution":{"observed_at":"2026-08-16T04:47:05.722747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.090828Z","title":"Wasserstein quantum M onte C arlo: a novel approach for solving the quantum many-body schr \\\"o dinger equation","venue":null,"work_id":"151cb709-3c97-4c0e-8d5c-98270563fcda","year":2023},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.727282Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:9cf0fccd8bb789d32e5bd16fc3fd56697692aeb1f2ce10fc3742a186d402d7aa","observation_id":"afd51786-a8c3-48b1-b167-0d308880fc81","resolution":{"observed_at":"2026-08-16T04:47:06.094875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.080175Z","title":"Learning to score behaviors for guided policy optimization","venue":null,"work_id":"bc915a43-b1e9-40ce-aeb3-f34577c48a15","year":2020},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.731386Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:f8523f68e5c1ef2468fd38a00d587c3d2841291fe072a8675d5f492b15109c77","observation_id":"f9fe4337-2e4f-4197-ae50-0dc6f03d9957","resolution":{"observed_at":"2026-08-16T04:47:06.083773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3584","last_updated":"2014-02-17T16:29:27Z","snapshot_observed_at":"2026-08-16T03:03:38.353843Z","submitted_at":"2013-01-16T04:47:02Z","title":"Revisiting Natural Gradient for Deep Networks","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3584","snapshot_observed_at":"2026-08-16T04:47:05.734888Z","title":"and Bengio, Y","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.734888Z"},"links":{"cited_paper":"/paper/1301.3584","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:7c26519502d6bfd3ff21d8f42ba95f129a3bae0870755d4ecb60fe7c59fe5b03","observation_id":"75eb8626-fb33-486c-b607-92acf35b5274","resolution":{"observed_at":"2026-08-16T04:47:05.734888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.070301Z","title":null,"venue":null,"work_id":"370d831e-e583-427a-84e6-87306d2cdc93","year":1997},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.739123Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:513b2d024dd1c8bf874f5e78b1087fd1a92bf306894a8a9ffaf5269919073076","observation_id":"d6f13103-9698-4474-9d76-bc0048a81deb","resolution":{"observed_at":"2026-08-16T04:47:06.073639Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.060746Z","title":null,"venue":null,"work_id":"6cbbe420-03ee-45b3-9f7e-f4df803816b9","year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.742610Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:0ecdbc95d2eb4a69475e6e60e024b4479bddadb76fad8b7b5364b13fc520b61a","observation_id":"800c788b-db9b-4b7d-a572-59a67930c74c","resolution":{"observed_at":"2026-08-16T04:47:06.063889Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.050794Z","title":"Trust region policy optimization","venue":null,"work_id":"2f584d2c-5366-4f39-af64-cab189641839","year":2015},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.746388Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:f6db09369e64195ea3ea4e0235dc0281d7d413a39863b8881090b3d6a25c1f15","observation_id":"094c430b-f82f-4804-b88c-8209fbf8b329","resolution":{"observed_at":"2026-08-16T04:47:06.054524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-15T05:06:05.489107Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-16T04:47:05.750096Z","title":"High-dimensional continuous control using generalized advantage estimation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.750096Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:442060622ac6b532a2725e60babf0557924c35e64d11fea9d3680da276e50dee","observation_id":"e8ff4f7c-2665-4a90-8f0b-8d98c02f2f19","resolution":{"observed_at":"2026-08-16T04:47:05.750096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T04:47:05.753537Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.753537Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:95122a310b80b7080e0c7e803e71bc55b2bb71375908308a3c475dc271209df9","observation_id":"368ea6c0-f820-49db-9008-38cc22728977","resolution":{"observed_at":"2026-08-16T04:47:05.753537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.040960Z","title":"Deterministic policy gradient algorithms","venue":null,"work_id":"c55544aa-7d7d-4086-9a33-1d8a7acb2e7a","year":2014},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.757112Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:6b2b005075f0218b0eef144613dd486b6c3988b99b0bbf3f383dcc9040e7df1b","observation_id":"07849974-2fdd-4b13-8a43-d4366ea6a636","resolution":{"observed_at":"2026-08-16T04:47:06.044687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-08-14T11:10:18.316745Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-16T04:47:05.760618Z","title":"F., Abdolmaleki, A., Springenberg, J","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.760618Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:b24229f77b9121312bf94793ddbf30e90e4e306963eb91426daa4d3aa524e4f7","observation_id":"49344668-057b-44f7-aa5c-cc03726391f9","resolution":{"observed_at":"2026-08-16T04:47:05.760618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.763904Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.763904Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:7fda28edb4a3ac4217c01aa50cb4dfe85f55c4f6f6eba12d47b648d09cfb1f93","observation_id":"6dee8b22-00dd-4fd2-953b-4b7fa8930f26","resolution":{"observed_at":"2026-08-16T04:47:05.763904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.767085Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.767085Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:726b90db86d51ec652e9be6d867254e60d0ffd95afc8d19117266f64be42f810","observation_id":"e000d2e0-7711-4541-8ec6-49ec0d647327","resolution":{"observed_at":"2026-08-16T04:47:05.767085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00690","last_updated":"2018-01-02T15:48:14Z","snapshot_observed_at":"2026-08-01T20:24:08.300098Z","submitted_at":"2018-01-02T15:48:14Z","title":"DeepMind Control Suite","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00690","snapshot_observed_at":"2026-08-16T04:47:05.770349Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.770349Z"},"links":{"cited_paper":"/paper/1801.00690","citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:5c7499e3d439634c3ea3be9be9a196a326500f7c35174b9b9e07d594e7b09afb","observation_id":"e5e35a59-79ac-48c1-99df-a0c872ebd9c8","resolution":{"observed_at":"2026-08-16T04:47:05.770349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.773879Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.773879Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:c61925474e5058bbb8a39792ba2d803e6a81eab25ed4d2ea7af83f067144527e","observation_id":"f4975490-ef45-488d-9b33-09be25f5bf14","resolution":{"observed_at":"2026-08-16T04:47:05.773879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.776825Z","title":"D., Michi, A., Chervonyi, Y., Davies, I., Paduraru, C., Lazic, N., Felici, F., Ewalds, T., Donner, C., Galperti, C., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.776825Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:e88d88de5f7b2beff6b3b10ef8cf84535722b898df5085fa248451af46f2cebb","observation_id":"1b4fa37c-7da9-453d-82ff-66061c19dcde","resolution":{"observed_at":"2026-08-16T04:47:05.776825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:06.007084Z","title":"dm\\_control: Software and tasks for continuous control","venue":null,"work_id":"247e4458-0338-4811-a00b-705cfcc03815","year":2020},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.779820Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:022ebd6eb8ae83d42f0e3c5f26f9cd82df6cda4958477f47c54caf62830caae6","observation_id":"72b0774e-5686-4f6c-81fb-ee1b71650855","resolution":{"observed_at":"2026-08-16T04:47:06.010833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.996975Z","title":"Double q-learning","venue":null,"work_id":"32241e07-7b3b-4fb6-b653-ff0f269ddbdb","year":2010},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.783069Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:5465713d69c5575b9296408e68d061a2e0ee4ea89dca3b118312118695de2d58","observation_id":"76ec6004-2123-427e-af7e-1944d25931b7","resolution":{"observed_at":"2026-08-16T04:47:06.000229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.985842Z","title":"and Wiering, M","venue":null,"work_id":"91873b2e-1034-436c-b79a-6d553e36a2de","year":2007},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.786087Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:1157b50960007aed0774511a981ccb45858f21c5a9a049f616bd860d0a8eb22d","observation_id":"3aa6ab08-bd3a-4050-a7d9-e48c39a41b19","resolution":{"observed_at":"2026-08-16T04:47:05.989811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.974972Z","title":"Beyond regression: N ew tools for prediction and analysis in the behavioral sciences","venue":null,"work_id":"2d29e7d3-4f0d-468a-90ec-810232721b2e","year":1974},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.789226Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:23d26130432250d5ce26d1a3fc9132e02fad006a7d62f1e477133b1aa25b60b7","observation_id":"2014b134-8925-4098-b8d1-a254e7e549b1","resolution":{"observed_at":"2026-08-16T04:47:05.978635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.792655Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.792655Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:f37e9aa1ecd180dc11b3327b98059496e2c5f04992e4a11a9d35efa191be1287","observation_id":"7ec0bc46-1d29-498e-8564-414468894dd6","resolution":{"observed_at":"2026-08-16T04:47:05.792655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:47:05.959539Z","title":"Policy optimization as W asserstein gradient flows","venue":null,"work_id":"b4b11908-1b8d-4435-aad3-bb576bc0d414","year":2018},"citing_paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-16T04:47:05.795761Z"},"links":{"citing_paper":"/paper/2505.00663"},"observation_digest":"sha256:7cab217bdcd885ace82e8315d482a1c8e39d2f9de67a5a0900957f454e4c6cd3","observation_id":"8b443736-3676-4c3d-a32e-2b9135f53f77","resolution":{"observed_at":"2026-08-16T04:47:05.962950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00663","last_updated":"2025-05-01T17:07:01Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T05:45:08.928570Z","submitted_at":"2025-05-01T17:07:01Z","title":"Wasserstein Policy Optimization"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 5 inbound Pith citation observations for arXiv:2505.00663."}