{"as_of":"2026-08-17T07:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ed3bbbf57231155c40f82fede447eb726217e5514d5a383844fdb152875d3ff5","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:32:58.885798Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12568/citation-record","integrity":"/paper/2504.12568/integrity","json":"/paper/2504.12568/citation-record.json","paper":"/paper/2504.12568"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.10902","last_updated":"2019-07-25T08:55:22Z","snapshot_observed_at":"2026-08-15T20:18:50.969519Z","submitted_at":"2019-07-25T08:55:22Z","title":"Optuna: A Next-generation Hyperparameter Optimization Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10902","snapshot_observed_at":"2026-08-16T12:32:58.756420Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.756420Z"},"links":{"cited_paper":"/paper/1907.10902","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:2767d28f7d4b382839526bd29d0a4778f948f1f8cdca85214349adf851c82b10","observation_id":"b43e0d69-3662-49fe-a12a-070e4320112f","resolution":{"observed_at":"2026-08-16T12:32:58.756420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1207.4708","last_updated":"2013-06-21T18:07:06Z","snapshot_observed_at":"2026-08-15T00:52:42.385638Z","submitted_at":"2012-07-19T15:33:25Z","title":"The Arcade Learning Environment: An Evaluation Platform for General Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.4708","snapshot_observed_at":"2026-08-16T12:32:58.762671Z","title":"Bellemare, Yavar Naddaf, Joel Veness, and Michael Bowling","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.762671Z"},"links":{"cited_paper":"/paper/1207.4708","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:a96143026586733e0951072e0abf5e12a88f90fd9f34c526e2cae0d34699fd50","observation_id":"d20f1554-c2e8-409b-abf5-044423659c62","resolution":{"observed_at":"2026-08-16T12:32:58.762671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:59.365388Z","title":null,"venue":null,"work_id":"910d1e34-441d-4e01-81fb-14c406ac1d29","year":2011},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.767779Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:0ee3ca759e981d93e8421751d379eedf0ea234bd71443a4c2929636b914d6784","observation_id":"c1c60fa0-26be-4f0a-bc71-5487c7564c4c","resolution":{"observed_at":"2026-08-16T12:32:59.395194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06560","last_updated":"2018-10-29T18:02:53Z","snapshot_observed_at":"2026-08-14T20:02:29.755744Z","submitted_at":"2017-12-18T18:10:39Z","title":"Improving Exploration in Evolution Strategies for Deep Reinforcement Learning via a Population of Novelty-Seeking Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.06560","snapshot_observed_at":"2026-08-16T12:32:58.773221Z","title":"Stanley, and Jeff Clune","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.773221Z"},"links":{"cited_paper":"/paper/1712.06560","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:71160870a95675110d13cbf0748ea83da2b112388c042cc1156552e235d1bda2","observation_id":"1ea9a75e-2d0e-4a74-887f-317202e05aaa","resolution":{"observed_at":"2026-08-16T12:32:58.773221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05368","last_updated":"2020-04-22T03:27:46Z","snapshot_observed_at":"2026-08-07T15:13:45.302595Z","submitted_at":"2020-02-13T06:59:26Z","title":"Effective Reinforcement Learning through Evolutionary Surrogate-Assisted Prescription","version":2},"cited_work":{"arxiv_id":"2002.05368","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.05368","snapshot_observed_at":"2026-08-16T12:32:59.132697Z","title":"Effective Reinforcement Learning through Evolutionary Surrogate-Assisted Prescription","venue":"cs.NE","work_id":"bbcf0b64-b1b2-47f0-9708-585cee3228ae","year":2020},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.778414Z"},"links":{"cited_paper":"/paper/2002.05368","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:7e56cdb8901d3c9b8dc90223b7972cd488dc321b08da4ccae556a4fe889af45a","observation_id":"2cb7c1eb-051b-49b7-a2f5-143b300fc372","resolution":{"observed_at":"2026-08-16T12:32:59.141680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-16T12:32:58.784184Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.784184Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:c9df270d9b900e8da0e0bfe58f6d3a73d3be2ab5feabd7590134cd2958f2157b","observation_id":"7c9a5b4c-a97a-408c-b787-f362a8679664","resolution":{"observed_at":"2026-08-16T12:32:58.784184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.790142Z","title":"LeCun, B","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.790142Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:2c5a1be4e1583e7ace1afe470aadf0333147ea1f12105252d433907e5e651b82","observation_id":"fc0cccf9-6d52-4c91-965a-83d179ab36c2","resolution":{"observed_at":"2026-08-16T12:32:58.790142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.795130Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.795130Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:8f4ae6dc3069b3e899f97c6d78cc6ae59bf2d7a031cec3bab2e7593711d29554","observation_id":"7834643c-c9e7-45ae-96f0-c036a218c2f8","resolution":{"observed_at":"2026-08-16T12:32:58.795130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00548","last_updated":"2017-03-04T23:13:05Z","snapshot_observed_at":"2026-08-14T21:14:00.557037Z","submitted_at":"2017-03-01T23:40:42Z","title":"Evolving Deep Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00548","snapshot_observed_at":"2026-08-16T12:32:58.801681Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.801681Z"},"links":{"cited_paper":"/paper/1703.00548","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:e2bb6fa31f30eaa6d2ee6b8415a25871bd520fe369107b7c60085f890ae2a9c3","observation_id":"258092c3-9f51-4d33-97ca-a7403929e0c3","resolution":{"observed_at":"2026-08-16T12:32:58.801681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1602.01783","last_updated":"2016-06-16T16:38:45Z","snapshot_observed_at":"2026-08-14T22:11:38.852257Z","submitted_at":"2016-02-04T18:38:41Z","title":"Asynchronous Methods for Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.01783","snapshot_observed_at":"2026-08-16T12:32:58.807134Z","title":"Lillicrap, Tim Harley, David Silver, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.807134Z"},"links":{"cited_paper":"/paper/1602.01783","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:51eddef350aad5c25ca3e1e410f6b29398dd7e7546796739456b11a01f61dd8f","observation_id":"6fcf6ed2-cde1-4d81-866b-802490fe6666","resolution":{"observed_at":"2026-08-16T12:32:58.807134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-16T12:32:58.812868Z","title":"Riedmiller","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.812868Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:47836d68053026c36eab9af8ec903105bf33d1f62ea07ade62c344431cd9634c","observation_id":"64e880e7-d454-43be-ad6d-18209562856c","resolution":{"observed_at":"2026-08-16T12:32:58.812868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.818950Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.818950Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:efcf0e62a3e478377b2d0094229638e7043535b0c8ae420b2a4cc4847909f006","observation_id":"b666516e-87ca-44fc-85df-08d78dbcdfdb","resolution":{"observed_at":"2026-08-16T12:32:58.818950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:59.230303Z","title":null,"venue":null,"work_id":"dbeb135e-a6ac-445f-aad5-b95d2361ae2a","year":2025},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.829865Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:151bbfb413ba95ee73af911369ed1a3a116a74378d25fcd88a35914cfa353036","observation_id":"f0050898-77fa-435c-b008-9fb808fcd08a","resolution":{"observed_at":"2026-08-16T12:32:59.287611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.834697Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.834697Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:0010091601789ab9f48f0d8fcd1e6ab942661011f80a14fda88b35d79d530db5","observation_id":"3a5fd67d-ea90-4b98-9529-2217ce5903cc","resolution":{"observed_at":"2026-08-16T12:32:58.834697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.839428Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.839428Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:94db3ae425064610e6226fbbdb1c3e38769e2b2994390426aec7237ad60c6180","observation_id":"25d2c83d-e0f4-486c-942a-89c1e86cb5ad","resolution":{"observed_at":"2026-08-16T12:32:58.839428Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-08-14T21:12:24.197125Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-16T12:32:58.845268Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.845268Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:cad666221f56d13af33f406921f47bd2886ceb70e06badc1548db67f6e22a920","observation_id":"ba8af3ac-e005-46d7-b247-1ca2274ffc58","resolution":{"observed_at":"2026-08-16T12:32:58.845268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-16T12:32:58.851369Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.851369Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:d3c18bc94bd59409ef93a650e8f1145a7d7bd7a6ff183bfea8c883481c48a000","observation_id":"5f0588a6-41f2-43c1-a5ce-a6bb4de0b74f","resolution":{"observed_at":"2026-08-16T12:32:58.851369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.856040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.856040Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:0dfe75bdf234ee00d4c1c9bc8b55a9d7e71fbcbd40ad0309d166a2ed24ed5f66","observation_id":"f0d862f1-4a49-4d51-a95d-0cda71fdf471","resolution":{"observed_at":"2026-08-16T12:32:58.856040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10045","last_updated":"2021-09-23T01:45:10Z","snapshot_observed_at":"2026-07-06T08:59:30.528340Z","submitted_at":"2020-02-24T02:36:22Z","title":"Optimal Advertising for Information Products","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10045","snapshot_observed_at":"2026-08-16T12:32:58.865853Z","title":"Stanley and R","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.865853Z"},"links":{"cited_paper":"/paper/2002.10045","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:274040a661cb2334b1ae279dcf6efb7fcd5eeef620fb0c62b69da3b3cdc99f2d","observation_id":"29aeddba-1058-45d2-8312-57c3cb8caf97","resolution":{"observed_at":"2026-08-16T12:32:58.865853Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.06567","last_updated":"2018-04-20T18:38:34Z","snapshot_observed_at":"2026-08-14T20:02:29.132687Z","submitted_at":"2017-12-18T18:22:05Z","title":"Deep Neuroevolution: Genetic Algorithms Are a Competitive Alternative for Training Deep Neural Networks for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.06567","snapshot_observed_at":"2026-08-16T12:32:58.871043Z","title":"Stanley, and Jeff Clune","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.871043Z"},"links":{"cited_paper":"/paper/1712.06567","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:f4b6d4a7676058ba1242af8040550e36da7a8d850a6c87f019d09f269191f63a","observation_id":"b4345154-42eb-4fa7-abc7-a9518981930b","resolution":{"observed_at":"2026-08-16T12:32:58.871043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.876318Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.876318Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:708818bb899cce94320256d4e3678c0dfbba1f48d0f4aeb1a8ff4b02534e5c61","observation_id":"8f7cf51d-543c-47a8-b916-37a21ed4ca51","resolution":{"observed_at":"2026-08-16T12:32:58.876318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01224","last_updated":"2017-07-10T14:38:10Z","snapshot_observed_at":"2026-08-14T21:32:02.118456Z","submitted_at":"2016-11-03T23:21:32Z","title":"Sample Efficient Actor-Critic with Experience Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01224","snapshot_observed_at":"2026-08-16T12:32:58.880894Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.880894Z"},"links":{"cited_paper":"/paper/1611.01224","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:f65ecb14963d75aa3117a0e03c43a917e7fdf2db934921567dcff515e5cc17d9","observation_id":"b59266da-ddab-4f2d-ae8a-9ef361fb60b1","resolution":{"observed_at":"2026-08-16T12:32:58.880894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.885798Z","title":"Williams","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.885798Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:92c57af0e78bfa3cbb540869d763e6a89e00cb915f64f3e9e0774f58d0999b52","observation_id":"f17263cc-c28f-4303-8056-6af0d767a132","resolution":{"observed_at":"2026-08-16T12:32:58.885798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:32:58.824420Z","title":"Nature 518 (2015), 529–533","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.824420Z"},"links":{"citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:200efd9eea6d951faa88d284edc0db5ba8715775c1e749c97c5a5edb917b79f3","observation_id":"af23db3d-fdc9-40ad-aacb-e6d5f6d35e2f","resolution":{"observed_at":"2026-08-16T12:32:58.824420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T12:32:58.861073Z","title":"CoRR abs/1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.861073Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.12568"},"observation_digest":"sha256:313994d49e6d8a67f60788835195a22a1dc230f0edee469e175a90382f4f57db","observation_id":"39309e09-c37e-414e-b44c-d727f10cf18c","resolution":{"observed_at":"2026-08-16T12:32:58.861073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12568","last_updated":"2025-04-17T01:33:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T22:42:14.281222Z","submitted_at":"2025-04-17T01:33:06Z","title":"Evolutionary Policy Optimization"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2504.12568."}