{"as_of":"2026-08-09T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68b16ee63cbd8771f58a990afbf1b25f6d7ab30179e95c2beedd43837e4bf8a3","coverage":[{"denominator":108,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:36:33.708676Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09417/citation-record","integrity":"/paper/2502.09417/integrity","json":"/paper/2502.09417/citation-record.json","paper":"/paper/2502.09417"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.190447Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.190447Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c637fab42b09688d772d818c2e4222bfbd1cdaa7f872428338645aeec3e48b82","observation_id":"e1228a0a-e975-45b3-960b-cd68601ca37f","resolution":{"observed_at":"2026-08-07T21:36:33.190447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.196234Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.196234Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a9ccf48edfbf2a0816fed88377c3c1578776cbb8f736b4b7c3bc563508d850d9","observation_id":"49bbd95e-d178-4c57-b174-75b2ce8d4323","resolution":{"observed_at":"2026-08-07T21:36:33.196234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.201565Z","title":"Deep reinforcement learning in smart manufacturing: A review and prospects,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.201565Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:74cd844317752ecc388a1c32cc7aea3beba4a3c9a3145d4dff9fc0d7bc431157","observation_id":"17c45300-98f1-4106-ab17-45ef09da20fb","resolution":{"observed_at":"2026-08-07T21:36:33.201565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.207234Z","title":"Applications of reinforcement learning in energy systems,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.207234Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:8738a9a97e370d30c1ee9fe685ae7dd62ef87f8f96d8c5ce11cd30c27674a758","observation_id":"02c5188b-dbf8-4d96-83f4-55d8b8b03173","resolution":{"observed_at":"2026-08-07T21:36:33.207234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.212197Z","title":"Reinforcement learning in robotics: A survey,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.212197Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c66b5a07e5e98c717697cd9171b630d01cb2a1e37e03b7700f77afdbf45b94f8","observation_id":"1ed9865d-c7da-4b76-89e6-ed0b164afe0d","resolution":{"observed_at":"2026-08-07T21:36:33.212197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.217564Z","title":"Reinforcement learning applied to production planning and control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.217564Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f7bfb5e4425ff3a286b91f2764458c29535f5d941db72235e4c08d3b7d689ef2","observation_id":"be8b5044-338f-4630-9e31-11e3c918caf5","resolution":{"observed_at":"2026-08-07T21:36:33.217564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.223245Z","title":"A review on reinforcement learning: Introduction and applications in industrial process control,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.223245Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:17a4842d9ecd50e53d5e303da9cff7eee087e3a44eaae09b0ec484e039c4aa2d","observation_id":"4f3c26f1-ea9a-4db5-94b2-03e80f7a6e12","resolution":{"observed_at":"2026-08-07T21:36:33.223245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.228590Z","title":"Deep reinforcement learning for inventory control: A roadmap,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.228590Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:7f1fb6b5c51c0230eb6f1c628075c1856754e46523df533ab24d0a59096b1d25","observation_id":"77ac5118-00f6-4e3a-bb4f-7f65f900aa6f","resolution":{"observed_at":"2026-08-07T21:36:33.228590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.233323Z","title":"Metaheuristics in combinatorial optimization: Overview and conceptual comparison,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.233323Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:4ef7ce67d6f4805ae744600174eb8e0873c6c98f2417488ee6de9dfc948e9d91","observation_id":"98f87576-114b-4095-b2d5-197db06aa285","resolution":{"observed_at":"2026-08-07T21:36:33.233323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07274","last_updated":"2018-11-26T04:56:31Z","snapshot_observed_at":"2026-07-06T05:27:30.168672Z","submitted_at":"2017-01-25T11:52:11Z","title":"Deep Reinforcement Learning: An Overview","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07274","snapshot_observed_at":"2026-08-07T21:36:33.238458Z","title":"Deep reinforcement learning: An overview,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.238458Z"},"links":{"cited_paper":"/paper/1701.07274","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:dd6896203d38488ee3660bd6f2210d12bb812fde7bff4bb59ba302aebb90f84f","observation_id":"07806f6f-635b-41ba-b86c-0454111b9039","resolution":{"observed_at":"2026-08-07T21:36:33.238458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.243952Z","title":"Deep reinforcement learning: A brief survey,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.243952Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:37b4526a789286662573ea457de1ed03da572707a3ce57039709555cbcefb9da","observation_id":"c2c0afd4-2d13-4cd1-a148-bdb8649ddbd8","resolution":{"observed_at":"2026-08-07T21:36:33.243952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.249382Z","title":"A deep reinforcement learning approach for chemical production scheduling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.249382Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:48de7490bf1fd6e76fa8565f9da8ee4129484e6f00a53a8ce8b642b46f5e0df8","observation_id":"1f4390e4-f241-46f6-bf72-c8dc936162ed","resolution":{"observed_at":"2026-08-07T21:36:33.249382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.254402Z","title":"Intelligent scheduling of discrete automated production line via deep reinforcement learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.254402Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:d6d6779b604aa37e8d42a346db070f38854dee560b027bed267826ec6c864162","observation_id":"092bbfb2-5b62-4176-9742-e3faa75bcac5","resolution":{"observed_at":"2026-08-07T21:36:33.254402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.259514Z","title":"A reinforcement learning method to scheduling problem of steel production process,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.259514Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a893994e15f79848a6c3a8430e6afac75a8a3ccb33a4bea9d4e0ba900211da7f","observation_id":"8f581a0b-572f-41da-aa4c-22dbd3f697de","resolution":{"observed_at":"2026-08-07T21:36:33.259514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00636","last_updated":"2022-03-09T21:16:42Z","snapshot_observed_at":"2026-08-09T14:37:21.639540Z","submitted_at":"2022-03-01T17:25:40Z","title":"Distributional Reinforcement Learning for Scheduling of Chemical Production Processes","version":2},"cited_work":{"arxiv_id":"2203.00636","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.00636","snapshot_observed_at":"2026-08-07T21:36:34.145440Z","title":"Distributional Reinforcement Learning for Scheduling of Chemical Production Processes","venue":"eess.SY","work_id":"5f4659ae-612d-464a-893d-4f635ef44d03","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.264933Z"},"links":{"cited_paper":"/paper/2203.00636","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:e6fb129266697d880f8d1276bb7138a5d3ff4d47b30f3aee7ec1c2c822ac2ce6","observation_id":"e85d2636-7391-4951-88ac-b4fe01ec0ec8","resolution":{"observed_at":"2026-08-07T21:36:34.150530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04037","last_updated":"2020-06-07T04:02:59Z","snapshot_observed_at":"2026-08-08T20:46:37.612139Z","submitted_at":"2020-06-07T04:02:59Z","title":"Reinforcement Learning for Multi-Product Multi-Node Inventory Management in Supply Chains","version":1},"cited_work":{"arxiv_id":"2006.04037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.04037","snapshot_observed_at":"2026-08-07T21:36:34.123449Z","title":"Reinforcement Learning for Multi-Product Multi-Node Inventory Management in Supply Chains","venue":"cs.LG","work_id":"1d8b4090-27dd-41af-b2b2-4f3bb35113ce","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.270606Z"},"links":{"cited_paper":"/paper/2006.04037","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:dce58981488c36d6b4ad564c4e97a97e5d9300b5356c57d3ceefb6a04db561ff","observation_id":"50c6bcaf-e1fa-497e-8c4c-20836238db5d","resolution":{"observed_at":"2026-08-07T21:36:34.128913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.276066Z","title":"Reward shaping to improve the performance of deep reinforcement learning in perishable inventory management,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.276066Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:20ab67fe236ee6e3b269740a522fa2393d480ba7c3375a4fd7fee85a4d699ccf","observation_id":"bd0797c2-3e08-459d-80e3-6980351a603c","resolution":{"observed_at":"2026-08-07T21:36:33.276066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.280831Z","title":"Cooperative multi-agent reinforcement learning for inventory man- agement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.280831Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5e2b5e87d73a62b8eab139edaa08eaad1f393d5192313fe037e7fff72c86efe1","observation_id":"1e673c8e-0458-415c-af6f-d97e8da66250","resolution":{"observed_at":"2026-08-07T21:36:33.280831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01649","last_updated":"2023-08-03T09:31:45Z","snapshot_observed_at":"2026-07-06T16:02:03.144875Z","submitted_at":"2023-08-03T09:31:45Z","title":"MARLIM: Multi-Agent Reinforcement Learning for Inventory Management","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01649","snapshot_observed_at":"2026-08-07T21:36:33.285873Z","title":"Marlim: Multi-agent reinforcement learning for inventory management,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.285873Z"},"links":{"cited_paper":"/paper/2308.01649","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:dc155e252efd4736c7192815b1dee7816123b88958f7488bb750b1dfaa64909f","observation_id":"3173f6d7-6862-4fac-bd11-dad2466e3ed0","resolution":{"observed_at":"2026-08-07T21:36:33.285873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.291435Z","title":"Reinforcement and deep reinforce- ment learning-based solutions for machine maintenance planning, scheduling policies, and optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.291435Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:af6b5f796545c2909a92b7106bc79fc479ae81e56e037c8d04d3ae275abd60a3","observation_id":"4ed62436-cd2f-4f9a-a31c-af7d2e58250a","resolution":{"observed_at":"2026-08-07T21:36:33.291435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.296552Z","title":"Reinforcement learning for dynamic condition-based maintenance of a system with individually repairable components,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.296552Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:4d799dbe6b1747621aefa37d04d63a5acd00cdc8bef3452557e018ebb2ca13f0","observation_id":"dc6b4fd7-8851-4360-b2b2-040359d522b5","resolution":{"observed_at":"2026-08-07T21:36:33.296552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.301291Z","title":"Dynamic maintenance model for a repairable multi-component system using deep reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.301291Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a9a1338e916662c1892ed93293d956c0e2bad5040b1017cbc1ad25237894eead","observation_id":"75427182-3295-43c2-9978-b96a43c1e503","resolution":{"observed_at":"2026-08-07T21:36:33.301291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.306212Z","title":"Aircraft main- tenance check scheduling using reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.306212Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:58800b975598e33ef03dd8f634079f43041f4666d9ae71316410fb1246ddac36","observation_id":"7d4924d7-3694-44d6-a8f0-1ff7f70a7980","resolution":{"observed_at":"2026-08-07T21:36:33.306212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.310870Z","title":"Network maintenance planning via multi-agent reinforcement learn- ing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.310870Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:b3259b4a545b801d3a3f5207a33d6d04e2bb37c7ebe25ab7651c0f8c2cf31830","observation_id":"1fff148a-67d5-4091-8c5c-df02609849ec","resolution":{"observed_at":"2026-08-07T21:36:33.310870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.315478Z","title":"Reinforcement learning for statistical process control in manufacturing,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.315478Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f365ceb7126f15610387172e1b65e7252b1d644cf8104d134381fe711e2505ac","observation_id":"6a0797b0-6f65-465a-9067-0a38339cc954","resolution":{"observed_at":"2026-08-07T21:36:33.315478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.320310Z","title":"Explainable reinforcement learning in production control of job shop manufacturing system,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.320310Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:49ba101795233fe41ebf7818be76de7a282ac17ec7af69d0549c12898bfdc981","observation_id":"3faed340-6296-4a10-a72c-96f169277563","resolution":{"observed_at":"2026-08-07T21:36:33.320310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.325114Z","title":"Using process data to generate an optimal control policy via apprenticeship and reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.325114Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:3429537081e55986047360467d71b9c51f3bd49a779e96e4c25387786ef228be","observation_id":"80ed8307-ae0e-4cb1-aae9-2471e4c02f33","resolution":{"observed_at":"2026-08-07T21:36:33.325114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.330402Z","title":"Reinforcement learning for process control with application in semiconductor manufacturing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.330402Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:be564a0604800eb9d15b7615796a6e0e859977a3e597dd5b5f74a9fb75b38853","observation_id":"5da87fee-4c7d-4885-9322-685a70ebdbeb","resolution":{"observed_at":"2026-08-07T21:36:33.330402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.335588Z","title":"Reinforcement learning for whole-building hvac control and demand response,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.335588Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:bb6a02cbfab4c41bb326529cb60d6d31829a1372a42fd2151b23693236f13241","observation_id":"4d6d80e1-92ca-4cbb-827a-2a2d409815cb","resolution":{"observed_at":"2026-08-07T21:36:33.335588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.340446Z","title":"Using meta reinforcement learning to bridge the gap between simulation and experiment in energy demand response,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.340446Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:2fbd5cb551cd07324de5990025353ad110eecd8a52ebda8c02401af6f1484278","observation_id":"42893808-7b3d-40aa-803c-21b0fb442131","resolution":{"observed_at":"2026-08-07T21:36:33.340446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.345556Z","title":"Multiagent reinforce- ment learning for energy management in residential buildings,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.345556Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f295adf383f8ee3761332475ea993d03f4bc1f05711de937f94c6adb4ef3c31b","observation_id":"64b59504-e520-4cbb-821e-c4a41865e3b8","resolution":{"observed_at":"2026-08-07T21:36:33.345556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.350303Z","title":"Deep reinforcement learning-based demand response for smart facilities energy management,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.350303Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:83965ca820f28e1f88910d4ffe242bfa0b047a33fb6970cbb15dbfd0a0d43586","observation_id":"a2cfac70-59a5-4229-bec6-c0c34a896022","resolution":{"observed_at":"2026-08-07T21:36:33.350303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.118425Z","title":"Multi-agent deep rein- forcement learning based demand response for discrete manufacturing systems energy management,","venue":null,"work_id":"d32cac77-f217-43e6-a341-20025e8800c5","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.354947Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5845c5b9a955bd5a125aad0d023e53d43b5770a01a48c13df12b172606e5e769","observation_id":"1cf0221b-edd3-4756-bef8-a223f754e4ad","resolution":{"observed_at":"2026-08-07T21:36:35.123388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.103221Z","title":"Testbed implementation of reinforcement learning-based demand response energy management system,","venue":null,"work_id":"6cb21e45-d1c3-4eb8-a4f5-e0994247cce7","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.359644Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:8d31542e0229254b34e50bcce0330d2cc93346d0e009e50814c255f6718ff357","observation_id":"347e4ab7-b9d9-4049-b8e7-f82367b9c081","resolution":{"observed_at":"2026-08-07T21:36:35.108220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.087457Z","title":"Deep reinforcement learning for energy management in a microgrid with flexible demand,","venue":null,"work_id":"b9082d67-0094-4e41-995e-a017515b984a","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.364648Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6540d482273d2f58fc920711af4f39e4bd20a8107cf3d6df02958b8af3147398","observation_id":"99a2c2d1-40b7-4ffb-8db0-4c5c106cf971","resolution":{"observed_at":"2026-08-07T21:36:35.092659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.071803Z","title":"Energy management for microgrids using a reinforcement learning algorithm,","venue":null,"work_id":"d49c199e-be12-4c6b-bd0a-3ab0831d06f1","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.369901Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:21927160a4da07391e5e8da122caf63b2664240360894cfd553e5f21e7a005b5","observation_id":"7ccde4fa-612d-479f-9c90-c41d7797235d","resolution":{"observed_at":"2026-08-07T21:36:35.076898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.056464Z","title":"Deep reinforcement learning- based energy management strategy for a microgrid with flexible loads,","venue":null,"work_id":"4ffe9946-aa52-422b-8ff8-efdba7e6571f","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.374847Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:d082ebc51b79121533d43416673290467ea322433483d23dcb2e32ebf5795d05","observation_id":"48958e56-0e98-44f3-9545-839af3dfbfaa","resolution":{"observed_at":"2026-08-07T21:36:35.061494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.039290Z","title":"Energy management in microgrid based on deep rein- forcement learning with expert knowledge,","venue":null,"work_id":"66620c41-d61c-46ba-a5aa-af3bd3bbee4f","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.379915Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:b7317a50b6481ec687e090d576e7df974d7136b20ddfeecd01c0d8fdd651cb3a","observation_id":"6bd8f1a8-8698-4f64-9c64-07cf32505de1","resolution":{"observed_at":"2026-08-07T21:36:35.045222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.021660Z","title":"Weather-aware data-driven microgrid energy manage- ment using deep reinforcement learning,","venue":null,"work_id":"6c4979cd-09fa-4209-a1b8-e5e67156fee0","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.385787Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:53eca503717ead31395870de8e7453afdc21e5347d2bb858fd45a1122876f1fd","observation_id":"40c6fcb0-efbd-4dc9-9645-8c7c9f416923","resolution":{"observed_at":"2026-08-07T21:36:35.026912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:35.005500Z","title":"Intelligent multi-microgrid energy management based on deep neural network and model-free reinforcement learning,","venue":null,"work_id":"b6f8d43f-d550-47cb-a130-056e280b0e9c","year":2019},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.390987Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:3f44ea4961a3c2bac361b08ba68e7eb55c9a81e4a2a73572ccb01cd0b086473c","observation_id":"11dd84d0-b1e5-44d9-8672-f173fb2df57e","resolution":{"observed_at":"2026-08-07T21:36:35.010835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.988614Z","title":"Reinforcement learning in sustainable energy and electric systems: A survey,","venue":null,"work_id":"39668a4e-8a6b-4f0e-907a-962eb15d3fb3","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.396006Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:8e32298321ad113c0dad5a693d7c5abb0866bafeb6a01586e134d4bdb1121ec0","observation_id":"f61c2f09-028e-424e-ae15-6307a217de58","resolution":{"observed_at":"2026-08-07T21:36:34.994185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.970926Z","title":"Reinforcement learning and its applications in modern power and energy systems: A review,","venue":null,"work_id":"941b7288-4a56-465c-8f5f-40b3f8112c72","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.400680Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:62a8c2da7d452a5248db5e84822c24a8668277b3aabc995a88c18619def2518e","observation_id":"1d31bb53-e907-4d2e-8514-a98310da4b04","resolution":{"observed_at":"2026-08-07T21:36:34.976513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.954311Z","title":"Reinforcement learning for selective key applications in power systems: Recent advances and future challenges,","venue":null,"work_id":"d37066d6-b4e2-4ca9-a91f-4c6bb3d017f2","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.406012Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:d975b97ee2e6e7db55dc15fcc144be5e5c0e678cca3eda0bf564c866914ee037","observation_id":"30c87fc8-0488-4274-ad9f-8a1135833591","resolution":{"observed_at":"2026-08-07T21:36:34.959177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.411370Z","title":"A systematic study on reinforcement learning based applications,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.411370Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:73088cc48259412dd612a7cb2268193420aea072738e9e840dafaa32365318da","observation_id":"dff334e1-0be3-4ba1-bf81-5b18b5b9b0af","resolution":{"observed_at":"2026-08-07T21:36:33.411370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.927834Z","title":"End-to-end deep reinforcement learning control for hvac systems in office buildings,","venue":null,"work_id":"3adf3d38-4ae9-45bf-a3b5-d12c0be26a09","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.416302Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:1928c568a62306a01dc1deb8332f4f486bc0d63e5c100673c688d3980b9f1128","observation_id":"324fb30e-43f3-468e-a472-472e03a0c28c","resolution":{"observed_at":"2026-08-07T21:36:34.932097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.914496Z","title":"A review of reinforcement learn- ing applications to control of heating, ventilation and air conditioning systems,","venue":null,"work_id":"3408377d-0848-4b8f-81a5-fa54b9c79174","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.421280Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6e93dd7c8809f056a2f592e98434be59b48b177c7f3ce28882570fd6876f4fc5","observation_id":"a9ebe5fc-d33a-4eeb-bd93-074165404b49","resolution":{"observed_at":"2026-08-07T21:36:34.918676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.901085Z","title":"Safe hvac control via batch reinforcement learning,","venue":null,"work_id":"85b4f596-1c0d-42ee-8fdc-49abd5ddc6de","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.426203Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c376a8a49ede7f325b9717cde5567569223f12c25c783b1808ac9fa568f5dea0","observation_id":"e0fcbf14-b415-459d-95fd-f187f1a7eff5","resolution":{"observed_at":"2026-08-07T21:36:34.905324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.886151Z","title":"Study on the application of reinforcement learning in the operation optimization of hvac system,","venue":null,"work_id":"9f7543a4-fe1a-4865-b5c5-9493cef06acc","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.431027Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:fa78d26d181eea88712f1f2b204833ed9501de1383f1b12bc7ef9788205449ba","observation_id":"a6327798-805b-4e04-9d6f-2739c85483b2","resolution":{"observed_at":"2026-08-07T21:36:34.891041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.870971Z","title":"Experimental evalu- ation of model-free reinforcement learning algorithms for continuous hvac control,","venue":null,"work_id":"6c1c98a6-c4a6-45ea-ad1a-8e62121941f2","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.436271Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:d8b6052c467d2eb5943998e90588e981ba9089c288cc52b9c970240268cb310c","observation_id":"b1da68b9-e07e-446b-8f1a-7cf744b9d80b","resolution":{"observed_at":"2026-08-07T21:36:34.875809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.856262Z","title":"Robotic arm motion planning based on curriculum reinforcement learning,","venue":null,"work_id":"bf25b649-cc22-4664-be9f-04bf48549c39","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.441081Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:ccc804479fe160082c7b81cad80263e568c6f9321956903b63b891efde8f9c4d","observation_id":"5698b67f-3bc1-494b-88a5-0200a1c37d8e","resolution":{"observed_at":"2026-08-07T21:36:34.860984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00492","last_updated":"2022-07-01T15:26:36Z","snapshot_observed_at":"2026-07-06T13:26:52.235619Z","submitted_at":"2022-07-01T15:26:36Z","title":"Reinforcement Learning Based User-Guided Motion Planning for Human-Robot Collaboration","version":1},"cited_work":{"arxiv_id":"2207.00492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00492","snapshot_observed_at":"2026-08-07T21:36:34.084340Z","title":"Reinforcement Learning Based User-Guided Motion Planning for Human-Robot Collaboration","venue":"eess.SY","work_id":"59dedb01-5c0a-4c43-b816-5610cc3d6542","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.445979Z"},"links":{"cited_paper":"/paper/2207.00492","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:4fd027a61e189705a23ef28d8eb74b816bd9c36b40dba3db3f89584126b7b844","observation_id":"70703579-d103-4c26-b4bf-d060840369dc","resolution":{"observed_at":"2026-08-07T21:36:34.090096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.841293Z","title":"Reinforcement learning with prior policy guidance for motion planning of dual-arm free-floating space robot,","venue":null,"work_id":"71cba3bb-3cb4-4634-ac2e-e4a7fe35df15","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.451666Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:e984043dbe159cbc5131cd93bea2f3727756dfd141a188998db5b491b1270c4c","observation_id":"8833ca38-04e6-464c-b349-7c238eb01ae6","resolution":{"observed_at":"2026-08-07T21:36:34.846502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.13966","last_updated":"2022-06-28T12:35:21Z","snapshot_observed_at":"2026-07-06T13:25:27.826746Z","submitted_at":"2022-06-28T12:35:21Z","title":"Dext-Gen: Dexterous Grasping in Sparse Reward Environments with Full Orientation Control","version":1},"cited_work":{"arxiv_id":"2206.13966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.13966","snapshot_observed_at":"2026-08-07T21:36:34.060349Z","title":"Dext-Gen: Dexterous Grasping in Sparse Reward Environments with Full Orientation Control","venue":"cs.RO","work_id":"49dc6504-6a1a-4624-b991-96bcedf17e1c","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.456710Z"},"links":{"cited_paper":"/paper/2206.13966","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:b4b0c9667c1a9308107e5a130e30498bc0eab8107a66d0b26d65cbeffeb1914c","observation_id":"7dc13f4f-04f4-4dd0-abad-6f1e55ef17bc","resolution":{"observed_at":"2026-08-07T21:36:34.065513Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.826795Z","title":"Robotic grasping using deep reinforcement learning,","venue":null,"work_id":"bcf8ca69-65c4-4a30-bb8f-0796ba9cbc0a","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.461980Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a47427789f6c4de913bb6d86db0fc90e8b78201d417e86a93e84e983ac8ed906","observation_id":"6618b32d-3e96-4ce5-a2f6-11defec4054b","resolution":{"observed_at":"2026-08-07T21:36:34.831637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.812131Z","title":"Mrcdrl: Multi-robot coordination with deep reinforcement learning,","venue":null,"work_id":"8676d1c6-a167-4579-a260-fcc9e1467ad0","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.467164Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:b483f65d216954e2cf81b26d027a5adf10299f2a3077486cf35560ffba6b29e5","observation_id":"9fbf6898-67ec-4459-8a8b-a17efeaa3f37","resolution":{"observed_at":"2026-08-07T21:36:34.817018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.796825Z","title":"Towards pick and place multi robot coordination using multi-agent deep reinforcement learning,","venue":null,"work_id":"ce5d3cbb-151d-4a4d-bd3f-9fdafae48fe2","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.472557Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:37932dadafa3b3d7447194194d7819c94ded4ed57c4977b0c57d4e4c89b605c5","observation_id":"304cb149-2520-4a71-b5f9-6dda9c93cd03","resolution":{"observed_at":"2026-08-07T21:36:34.801866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.781889Z","title":"Human-centered collaborative robots with deep reinforcement learn- ing,","venue":null,"work_id":"f9165283-44de-46a4-bfd3-d44dddcb30ae","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.477393Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:eff5991294e95389c0fa945138649569b94e2042aab7705c2f7dadbc6873e393","observation_id":"e26e0375-1e66-4b32-93e4-defe3ed8697e","resolution":{"observed_at":"2026-08-07T21:36:34.786998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.766634Z","title":"Explainable reinforcement learning for human-robot collaboration,","venue":null,"work_id":"5850502f-e3fc-4baf-8aa4-afb57b51152f","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.482259Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f3889b26ad988ad6e670c068f58f5729c810f1253a5f889525662e924be343d7","observation_id":"a5329fba-cc14-4147-9432-8827cc9de23a","resolution":{"observed_at":"2026-08-07T21:36:34.771673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.750955Z","title":"Real-world human-robot collaborative reinforcement learning,","venue":null,"work_id":"1bba76bf-3634-4ae9-9994-989847b71f78","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.487077Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:a07912da464c42d207ada2f30f551899ff07df3dd71990c1dc08ef9e005937d8","observation_id":"e9c26b50-51b6-46d4-a109-54ad10613235","resolution":{"observed_at":"2026-08-07T21:36:34.755910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06208","last_updated":"2024-06-25T11:11:00Z","snapshot_observed_at":"2026-07-06T16:30:12.703492Z","submitted_at":"2023-10-09T23:34:09Z","title":"Human-Robot Gym: Benchmarking Reinforcement Learning in Human-Robot Collaboration","version":2},"cited_work":{"arxiv_id":"2310.06208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.06208","snapshot_observed_at":"2026-08-07T21:36:34.038742Z","title":"Human-Robot Gym: Benchmarking Reinforcement Learning in Human-Robot Collaboration","venue":"cs.RO","work_id":"fba44a56-7f82-4873-b967-b21f34aa50b1","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.492184Z"},"links":{"cited_paper":"/paper/2310.06208","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:81fc64ebed5dfec61ba5b1d1ff3787d64cad3a204c310c90f92014500092e750","observation_id":"a3cebd9a-7306-41e0-980e-e3be2a21d1e0","resolution":{"observed_at":"2026-08-07T21:36:34.043976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.736129Z","title":"Towards safe human-robot collaboration using deep reinforcement learning,","venue":null,"work_id":"91baae6b-9ca2-4d7f-a787-16af7251251c","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.497527Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:31bfec997a35af7f970a67d4a792dab7a537f68b8759bb2334a6a54b6878db85","observation_id":"1d975f13-1b8d-4322-bc7c-b8b386f7c0f1","resolution":{"observed_at":"2026-08-07T21:36:34.741221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.720639Z","title":"A framework and algorithm for human-robot collaboration based on multimodal reinforcement learning,","venue":null,"work_id":"b30bb85f-5958-4c64-ab9b-a2b5d97eb340","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.502565Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:e97fed93e6e9b32c4aeb61d3d7d6cdd4cbafa7814cc285850765ce25fb4845e8","observation_id":"4d24db4b-5d3e-4ce4-808a-72c701bc2497","resolution":{"observed_at":"2026-08-07T21:36:34.726034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.706611Z","title":"A survey of learning-based robot motion planning,","venue":null,"work_id":"791b41b8-34cc-45d9-8785-d793fbe2e2fe","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.507880Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:9ff5b06ab8151d18ca077a7143d0a2296128d1bf53771f92b90fa996b2673eda","observation_id":"07085747-d61d-4340-a188-6e10b03d593c","resolution":{"observed_at":"2026-08-07T21:36:34.711109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.692383Z","title":"A survey on deep reinforcement learning algorithms for robotic manipulation,","venue":null,"work_id":"81919ccf-e99d-4b35-939c-cb79ebad1a30","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.512848Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:dd8cee6551389da41b2358ba32dcb79894e283392338e759ebe8c3b14bbd771b","observation_id":"b5f86b26-6acf-48ce-aa1f-5f4094a570ea","resolution":{"observed_at":"2026-08-07T21:36:34.696771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.677868Z","title":"Reward shaping to learn natural object manipulation with an anthropomorphic robotic hand and hand pose priors via on- policy reinforcement learning,","venue":null,"work_id":"405bf655-ce31-42a1-a5ab-ee0ea2972f83","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.517671Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:afd1f20b6284106f932ed1a66f2bbb5b3051a1cb7209610041c1a02993cb1736","observation_id":"a6ade5fc-00bc-479d-a77f-8bf827705595","resolution":{"observed_at":"2026-08-07T21:36:34.682569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.662286Z","title":"Enhancing robotic grasping of free-floating targets with soft actor-critic algorithm and tactile sensors: a focus on the pre-grasp stage,","venue":null,"work_id":"b1840859-64e6-40fe-80ca-3fe6d0f82e7b","year":2024},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.522486Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:04017cfe57ce6c366725e2d9a73b77a84c9eb031ffb0b24fc256bdac7a5cfacd","observation_id":"544cbe48-d6e9-47b8-8218-3278f40e9633","resolution":{"observed_at":"2026-08-07T21:36:34.667452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.645480Z","title":"Reinforcement learning for multi-robot system: A review,","venue":null,"work_id":"9413c418-19eb-49ae-b8a3-ebf2b33bd004","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.528484Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:59057049f497e7d15b84aae03e99610535e59e304f82b1a5bcc2647eb80daba9","observation_id":"4e1ef3d1-d871-46c9-9656-25a006853d42","resolution":{"observed_at":"2026-08-07T21:36:34.651171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.627898Z","title":"Coordination of a multi robot system for pick and place using reinforcement learning,","venue":null,"work_id":"5be00235-4ee2-4343-97a4-7432e2c0f649","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.534696Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:db213f6678967c34f51ca37ef709b4c9907c0f27677b4b44daf3f491652f5f66","observation_id":"ce4dd452-ff06-4335-8d09-119c9fbe2f4e","resolution":{"observed_at":"2026-08-07T21:36:34.633058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.612296Z","title":null,"venue":null,"work_id":"efbbcf3c-ea69-48b6-a148-12d87cb339a9","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.540512Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:cdbcd7bc4bea0b6365bd187aec3a5c49d82f36e79979d9ed4d7ae6075c1a5917","observation_id":"501b8719-94cd-4d3c-bf9b-104c37ee22c8","resolution":{"observed_at":"2026-08-07T21:36:34.617407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.596010Z","title":"Adaptive coordination of multiple learning strategies in brains and robots,","venue":null,"work_id":"c38406b2-3fce-463c-ac36-efc79aa85d41","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.546869Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:020852efb5fd9ae7fb9c89e93ae4a6e01bff295a4adc52e087a38c4ee83b27c0","observation_id":"16a6ebd3-002d-4a7a-ad9d-7b483a9f128d","resolution":{"observed_at":"2026-08-07T21:36:34.601441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.580133Z","title":"Study of sample efficiency improvements for reinforcement learning algorithms,","venue":null,"work_id":"e7a2eb87-17e2-48fa-aa7e-796e5a62482f","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.552190Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:30becf444446c3492625606b4e492ca39a0f6282f9dab207cd688fc887b8d698","observation_id":"550ce57c-396e-4014-87b6-9c82f2c81f7d","resolution":{"observed_at":"2026-08-07T21:36:34.585485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.04881","last_updated":"2021-02-09T15:27:47Z","snapshot_observed_at":"2026-07-06T10:39:49.134574Z","submitted_at":"2021-02-09T15:27:47Z","title":"Measuring Progress in Deep Reinforcement Learning Sample Efficiency","version":1},"cited_work":{"arxiv_id":"2102.04881","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.04881","snapshot_observed_at":"2026-08-07T21:36:34.017731Z","title":"Measuring Progress in Deep Reinforcement Learning Sample Efficiency","venue":"cs.LG","work_id":"b08ed17e-f267-4ddf-ab7b-537d6374a4ce","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.558901Z"},"links":{"cited_paper":"/paper/2102.04881","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:94afd4c3721aace2e729c1b08e5c50e42fce6b778ee8a9b8156695f0c8742c07","observation_id":"9fdb04d5-b5d0-4e98-b5ec-1b0ff458c82b","resolution":{"observed_at":"2026-08-07T21:36:34.022989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.13690","last_updated":"2021-01-16T23:51:53Z","snapshot_observed_at":"2026-08-09T07:50:15.166686Z","submitted_at":"2020-07-24T16:29:19Z","title":"Maximum Mutation Reinforcement Learning for Scalable Control","version":7},"cited_work":{"arxiv_id":"2007.13690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.13690","snapshot_observed_at":"2026-08-07T21:36:33.996132Z","title":"Maximum Mutation Reinforcement Learning for Scalable Control","venue":"cs.LG","work_id":"6fc1ba24-63db-4212-a912-f475e4215a25","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.565054Z"},"links":{"cited_paper":"/paper/2007.13690","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5e151d15fe025b96f15449cd453dd50f1f80136007feddfc1d4d9048fdee2531","observation_id":"d842fd78-6b4b-4bf4-9c6a-6f5c545a560e","resolution":{"observed_at":"2026-08-07T21:36:34.001403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.563687Z","title":"Sample efficient reinforcement learning method via high efficient episodic memory,","venue":null,"work_id":"4e8ac095-8f7a-488d-97f7-982935265e54","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.570915Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:102a86aaaf8e521224006b1baa22977aa5d4d0dbfde75a532a7d0641c76b8ae3","observation_id":"b3b6ec98-e4c1-4072-a26f-c0d1023d67c7","resolution":{"observed_at":"2026-08-07T21:36:34.569138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.576696Z","title":"Efficient online reinforcement learning with offline data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.576696Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:d97c2517f19eb23ae7d296458d9e3ee1bf4a6d0f27fccd7f28406d5d10446e0f","observation_id":"1b547937-483b-4429-9ad4-4913ae6e7ab8","resolution":{"observed_at":"2026-08-07T21:36:33.576696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.533811Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model,","venue":null,"work_id":"bfa26062-527b-4e67-9950-8c9ea0004497","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.582695Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:27aa95a4b089d4d6214eaea0022f8f5aa384a12849283a227c4718d4ada0e4e9","observation_id":"5bc23ff2-040c-4f99-929c-b7fbd140bfed","resolution":{"observed_at":"2026-08-07T21:36:34.539665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.516699Z","title":"Elastic step ddpg: Multi-step reinforcement learning for improved sample efficiency,","venue":null,"work_id":"3fc42c58-7295-4bc1-911f-fa5a78025a65","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.587857Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:2e45dc4b32267b0ff6dfde00155687e7cfdd6ff76c3e9b3b238b59b1c32a513f","observation_id":"97b57b1d-a763-40ee-ad38-fa8bdd7c3e30","resolution":{"observed_at":"2026-08-07T21:36:34.522087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.499915Z","title":"Sample-efficient reinforcement learning via conservative model-based actor-critic,","venue":null,"work_id":"6c16c1d9-57d9-454c-aeb0-633eabf39d82","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.593984Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:13a34e4b29718c21cdffe67ba8ead72b5b97d703b39c9bfa5ad7fa7f9ff79b8a","observation_id":"ee8173eb-355a-4df7-848d-84d4bd778d6b","resolution":{"observed_at":"2026-08-07T21:36:34.505362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.485662Z","title":"Safety robustness of reinforcement learning policies: A view from robust control,","venue":null,"work_id":"dde4ccd9-92a0-432a-a573-34b5c7d079f7","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.599188Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:63636aebde825444e972b1e8cf28469c85543cd1943b00ba40e71d33d8acfe94","observation_id":"0ddf61cb-00a0-4b3c-8ec3-9aebb00f6f46","resolution":{"observed_at":"2026-08-07T21:36:34.490108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06835","last_updated":"2023-09-13T09:34:21Z","snapshot_observed_at":"2026-07-06T16:17:50.837748Z","submitted_at":"2023-09-13T09:34:21Z","title":"Safe Reinforcement Learning with Dual Robustness","version":1},"cited_work":{"arxiv_id":"2309.06835","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.06835","snapshot_observed_at":"2026-08-07T21:36:33.974124Z","title":"Safe Reinforcement Learning with Dual Robustness","venue":"cs.LG","work_id":"e183010d-3c36-44b9-ad79-d440c1c4d8fc","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.604825Z"},"links":{"cited_paper":"/paper/2309.06835","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:976360da1179ec3360dd0ae3d0b4befb5d6d22d5e85c99716b5c24447b49101d","observation_id":"2cc06383-7502-4214-af5e-5a22cf820ace","resolution":{"observed_at":"2026-08-07T21:36:33.979594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14691","last_updated":"2023-03-02T02:56:47Z","snapshot_observed_at":"2026-07-06T13:15:10.457884Z","submitted_at":"2022-05-29T15:25:03Z","title":"On the Robustness of Safe Reinforcement Learning under Observational Perturbations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14691","snapshot_observed_at":"2026-08-07T21:36:33.610142Z","title":"On the robustness of safe reinforcement learning under observational perturbations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.610142Z"},"links":{"cited_paper":"/paper/2205.14691","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:dd75f779914f42bc6c442fb108427022c0f4a41a258f0059b7377dd292248446","observation_id":"d9c98fea-5183-47eb-b67d-026444cd6663","resolution":{"observed_at":"2026-08-07T21:36:33.610142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.471174Z","title":"Safe reinforcement learning using robust control barrier functions,","venue":null,"work_id":"c3785d34-42bb-4b9a-b5e8-53ac35ff7f0c","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.616906Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:cff813aeb5c0489bde44d13e69884df7d780c5ee98f3146fc66c668ff31af1d0","observation_id":"5457f1a7-3bd7-47a5-bc78-5d901f1baab8","resolution":{"observed_at":"2026-08-07T21:36:34.475887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.457149Z","title":"Safe reinforcement learning using robust action governor,","venue":null,"work_id":"7d5a2348-b8e1-4f75-b312-148a3b39ea27","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.621836Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:0a45c6659f267372b4a3962a505bf48342972ece754564effe341d1edd5fe0f0","observation_id":"9c128383-c9dc-4c0d-8e04-0710731d6ad2","resolution":{"observed_at":"2026-08-07T21:36:34.461578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.626931Z","title":"Safe reinforcement learning using robust mpc,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.626931Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:5393e3249ef810d386cac09ae9be5d090f2a040bb1e55e65d13a118996417f7f","observation_id":"226086d9-4c0c-49b2-9579-c358e5e98367","resolution":{"observed_at":"2026-08-07T21:36:33.626931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13375","last_updated":"2024-03-28T16:08:43Z","snapshot_observed_at":"2026-07-06T14:46:23.137171Z","submitted_at":"2023-01-31T02:39:52Z","title":"Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees","version":2},"cited_work":{"arxiv_id":"2301.13375","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.13375","snapshot_observed_at":"2026-08-07T21:36:33.933889Z","title":"Optimal Transport Perturbations for Safe Reinforcement Learning with Robustness Guarantees","venue":"cs.LG","work_id":"14844fdb-21ee-48da-a21e-419128dfb79d","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.631729Z"},"links":{"cited_paper":"/paper/2301.13375","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:c8cac2401a98fa1e3414194d41bb481add4b6ce78774dc742de6f44faa9b948b","observation_id":"0d91ed9e-980d-42b9-8eca-41f78d83e390","resolution":{"observed_at":"2026-08-07T21:36:33.939102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.433725Z","title":"Task-agnostic safety for rein- forcement learning,","venue":null,"work_id":"c74b8ef6-fdfa-48d9-82d2-878fef4cc969","year":2023},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.637192Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:28c1b4fb891a5c51b6f1fd77fb954569d5a21af7e2d343ad1b885c41164c5d44","observation_id":"dff55c0a-093b-4d0a-90fe-d9344f031119","resolution":{"observed_at":"2026-08-07T21:36:34.438028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.418868Z","title":"Falsification-based robust ad- versarial reinforcement learning,","venue":null,"work_id":"f102cf26-9eca-4b25-b084-d94eb9c02997","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.641895Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f55c62ac624457cc1be415e0fc931a802fc541c6fc348840088157a1002eb602","observation_id":"29b3ce88-d0b3-4d8a-9a68-69d81ff0f06d","resolution":{"observed_at":"2026-08-07T21:36:34.423999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13112","last_updated":"2022-02-24T10:32:08Z","snapshot_observed_at":"2026-07-06T12:22:17.012426Z","submitted_at":"2021-12-24T17:26:57Z","title":"A Survey on Interpretable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13112","snapshot_observed_at":"2026-08-07T21:36:33.646549Z","title":"A survey on interpretable reinforcement learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.646549Z"},"links":{"cited_paper":"/paper/2112.13112","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:ae24723a21dd4e7a8f381947e5c11c0af6c55e9e8a09bc33915d560567d4adff","observation_id":"503dd278-7361-4b56-8667-d90b26627b8f","resolution":{"observed_at":"2026-08-07T21:36:33.646549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11417","last_updated":"2021-06-21T21:30:08Z","snapshot_observed_at":"2026-08-07T12:51:40.590589Z","submitted_at":"2021-06-21T21:30:08Z","title":"Interpretable Model-based Hierarchical Reinforcement Learning using Inductive Logic Programming","version":1},"cited_work":{"arxiv_id":"2106.11417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11417","snapshot_observed_at":"2026-08-07T21:36:33.895145Z","title":"Interpretable Model-based Hierarchical Reinforcement Learning using Inductive Logic Programming","venue":"cs.LG","work_id":"aec605e3-76dd-41f4-9771-0b6be59788d9","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.651576Z"},"links":{"cited_paper":"/paper/2106.11417","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:7f4b68f61ff6b0080b43cb44e451dd989340f0b2d32450bea91e29dd9e0098a0","observation_id":"36328faf-762e-4051-a9a9-6e03687c19f5","resolution":{"observed_at":"2026-08-07T21:36:33.900439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04266","last_updated":"2022-06-09T04:23:26Z","snapshot_observed_at":"2026-07-06T13:18:57.269780Z","submitted_at":"2022-06-09T04:23:26Z","title":"There is no Accuracy-Interpretability Tradeoff in Reinforcement Learning for Mazes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04266","snapshot_observed_at":"2026-08-07T21:36:33.656651Z","title":"There is no accuracy- interpretability tradeoff in reinforcement learning for mazes,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.656651Z"},"links":{"cited_paper":"/paper/2206.04266","citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:de1535e33f12bdd56cd56da9615956c9c43d13996fcd162c867609202c5cbf8f","observation_id":"039c8826-59dd-45a1-86d0-63e374e46491","resolution":{"observed_at":"2026-08-07T21:36:33.656651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.402286Z","title":"What do rein- forcement learning models measure? interpreting model parameters in cognition and neuroscience,","venue":null,"work_id":"4a71098e-8a22-4e71-a86f-f00d9327634f","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.661666Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:143791cca9209d54fef9c08a003ec5c7d528147ffcf31e4389d1fe7bfdce2747","observation_id":"060a3d21-8994-4ba3-9c77-72db014205a7","resolution":{"observed_at":"2026-08-07T21:36:34.407812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.385472Z","title":"Reinforcement learning interpretation methods: A survey,","venue":null,"work_id":"6eec3b83-6657-418c-adc3-508e516d3d0f","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.666689Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6b265b588621122383543053be666e76e78aa2f2f4df5d84beffb08303952138","observation_id":"3f9ff627-597a-4669-a12c-dd8d83ed650e","resolution":{"observed_at":"2026-08-07T21:36:34.390612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.369664Z","title":"Self- supervised discovering of interpretable features for reinforcement learning,","venue":null,"work_id":"2dc780e9-4302-49eb-bfae-0892f3ff8a70","year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.671778Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:23cc05f0e45aca38badbc5aa5e266afcc57d41f821222749e6865b9f65d1cbee","observation_id":"b4292e42-6ae8-4514-a3d1-19e206c1950a","resolution":{"observed_at":"2026-08-07T21:36:34.374926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.353223Z","title":"Learning sparse evidence-driven interpretation to understand deep reinforcement learning agents,","venue":null,"work_id":"5e426a53-4d25-4641-ac76-56ca6541846a","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.676726Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:61e6d73a70d10e40164d26ac735fd4cada8cfa2a6d3f783df4c71cbe2ad9483f","observation_id":"9f8389df-804e-4f18-8799-c8c09b7af67c","resolution":{"observed_at":"2026-08-07T21:36:34.358993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.337161Z","title":"Meta- learning in neural networks: A survey,","venue":null,"work_id":"8c412206-0464-4d62-9505-f5948a7d50ab","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.681931Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:f7668914760df32db7f18bac2377c8ac5b19582fcdd837067e7df33f5355d6b0","observation_id":"cc37d66b-bf1a-460c-824d-7a63bbd33147","resolution":{"observed_at":"2026-08-07T21:36:34.342061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.320918Z","title":"Learning action translator for meta reinforcement learning on sparse-reward tasks,","venue":null,"work_id":"02d76e78-051b-47ea-b398-9145fee6311a","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.687168Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:8491c02fa7cad9e37b5433aa3e550a004ac8b639948a2762418a90bb7b39ac89","observation_id":"a5e3b93f-c857-4a58-bed6-1a4378ac9865","resolution":{"observed_at":"2026-08-07T21:36:34.325714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:33.692403Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.692403Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:6833b6504ae631c1a18d190780a4e8e8ca162eb28e0220b617bbbbf4f60b6ca2","observation_id":"126117cc-c59f-4078-8cbd-3923a748c2a5","resolution":{"observed_at":"2026-08-07T21:36:33.692403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.294614Z","title":"Effective reinforcement learning using transfer learning,","venue":null,"work_id":"1cf8fcca-b454-44fa-9f42-3cd9a6021aca","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.697555Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:76eedd6a19f1c70d9f2e4b930e2732abb85c07293c5f3bf6b8316ac691b7c940","observation_id":"808b3c83-1777-459a-a754-3ada3a3aa015","resolution":{"observed_at":"2026-08-07T21:36:34.299553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.279114Z","title":"Multi-source transfer learning for deep model-based reinforcement learning,","venue":null,"work_id":"1d04e001-0047-4358-b5ae-dbe4f22e7df9","year":2021},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.702827Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:631912bc3922e265fa3dcee344942293b517b7901b649a5a764023e3bcfa69fa","observation_id":"1268171f-12d1-4267-902c-662832d31dfe","resolution":{"observed_at":"2026-08-07T21:36:34.284441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T21:36:34.244671Z","title":"Efficient meta reinforcement learning for preference-based fast adaptation,","venue":null,"work_id":"53a48f76-5ddc-4c72-8447-8276229ab717","year":2022},"citing_paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T21:36:33.708676Z"},"links":{"citing_paper":"/paper/2502.09417"},"observation_digest":"sha256:2fdda4bf21afcf45501d337977e9fc1277979706fb0a95618b6b7c6bf698803b","observation_id":"1f0bd06a-6bff-4527-8419-76ff699b49a9","resolution":{"observed_at":"2026-08-07T21:36:34.266401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.09417","last_updated":"2025-02-13T15:40:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T01:43:53.124115Z","submitted_at":"2025-02-13T15:40:39Z","title":"A Survey of Reinforcement Learning for Optimization in Automation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":10,"verified_fuzzy":52},"total_outbound_references":108},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 108 outbound references and 0 inbound Pith citation observations for arXiv:2502.09417."}