{"as_of":"2026-08-10T05:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e2d92c9d11f40f5ceb74eede40af2fe4d650e46f243788e1f6a4421b8f85cb7b","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:44:15.289881Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.01329/citation-record","integrity":"/paper/2508.01329/integrity","json":"/paper/2508.01329/citation-record.json","paper":"/paper/2508.01329"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1903.08894","last_updated":"2019-03-21T09:42:41Z","snapshot_observed_at":"2026-08-04T21:37:15.275989Z","submitted_at":"2019-03-21T09:42:41Z","title":"Towards Characterizing Divergence in Deep Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.08894","snapshot_observed_at":"2026-08-06T05:44:11.402366Z","title":"Achiam, E","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.402366Z"},"links":{"cited_paper":"/paper/1903.08894","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:d5b2648ad09eb991e4850598325a2607c27859e3b9f458bd4d8a29e1a21e54cb","observation_id":"1eba9a00-639c-4083-85cb-f978864228db","resolution":{"observed_at":"2026-08-06T05:44:11.402366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.440034Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":"a92643a8-c7dc-4b12-a5a0-ab00e4788287","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.523139Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:dd40798be7e08d6da6ec82cfe114e891f2ae99b19ede68d8f1fa0d17fd61389f","observation_id":"0bd3b8ea-ca1a-401b-b5c1-521e33bd46b9","resolution":{"observed_at":"2026-08-06T05:44:16.445434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02019","last_updated":"2022-10-05T04:41:20Z","snapshot_observed_at":"2026-08-03T09:16:55.559588Z","submitted_at":"2022-10-05T04:41:20Z","title":"Atari-5: Distilling the Arcade Learning Environment down to Five Games","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02019","snapshot_observed_at":"2026-08-06T05:44:11.701517Z","title":"Atari-5: Distilling the arcade learning environment down to five games","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.701517Z"},"links":{"cited_paper":"/paper/2210.02019","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:80cae0bbea3f2c399c4e90dad3d8e0468e2e99198404c3ff9f51716a1c34674b","observation_id":"9012bf15-39fb-4c85-9e88-ae2930c1ae75","resolution":{"observed_at":"2026-08-06T05:44:11.701517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.424486Z","title":"Never give up: Learning directed exploration strategies, 2020","venue":null,"work_id":"88238fc9-3a2b-420f-885c-f014047ba57d","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.835102Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7dab4da75796aeb89d7ce5e4fbc137f515bebc64d04e440bf6fa2429ba2cb76d","observation_id":"65cb8308-9a86-4ddb-991d-a34a13b634e2","resolution":{"observed_at":"2026-08-06T05:44:16.429262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.409155Z","title":"Unifying count-based exploration and intrinsic motivation","venue":null,"work_id":"055854f6-26f3-420e-9efc-4695d664de97","year":2016},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:11.997083Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:0a8ba01ce0362430aa124407c85ea1a4b228ab3c34dd5cb27bd91fd820de055d","observation_id":"c158a74f-ce46-4a51-ac71-a3108eda206b","resolution":{"observed_at":"2026-08-06T05:44:16.414088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2747.28328","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.598346Z","title":"Bellemare, Yavar Naddaf, Joel Veness, and Michael Bowling","venue":null,"work_id":"9d13fcea-5db5-4f9f-8571-a96ded9c480d","year":2015},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.117380Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:42be784a939d5b5f6cd513f0a692a8f9068c37be6e423490bf1ba3a256fc9156","observation_id":"e4b604a0-5918-4310-bf80-63c9e5ed83a8","resolution":{"observed_at":"2026-08-06T05:44:15.608184Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.394529Z","title":"Bellemare, Will Dabney, and R \\' e mi Munos","venue":null,"work_id":"adca7b00-a600-47cc-b2b7-a87a5f4c1550","year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.284037Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:fb80a9b7eed6b8d3592b6d8c633111b9b4485db55154be57d484955a286890f6","observation_id":"714980d0-1038-4f32-8146-408f74c02da7","resolution":{"observed_at":"2026-08-06T05:44:16.399301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.379649Z","title":"The theory of dynamic programming","venue":null,"work_id":"efd6a112-87ba-4c86-8454-3fbea8f074ba","year":1954},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.418889Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:8e1a331a1d2d9c685d9b8ec92dbaa891bcc2a1d9b0592749696fc2daae13ee7b","observation_id":"91486c0e-7de8-4ad9-9868-1988227725aa","resolution":{"observed_at":"2026-08-06T05:44:16.384753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.364189Z","title":"Interference and generalization in temporal difference learning","venue":null,"work_id":"b0752afd-8c40-4bb0-970e-29a5de06f1d2","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.518429Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:77e2869ad5d93802aa0e9f118ebce46967151e615048f3fd0a3efdf543432402","observation_id":"4caee5a4-d6dc-4201-a34c-10df449dec34","resolution":{"observed_at":"2026-08-06T05:44:16.369073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.349319Z","title":"Exploration by random network distillation, 2018 a","venue":null,"work_id":"487610a4-9bcb-4c4f-9574-c041933a93b6","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.624275Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:6039d79a2cd5bc1ec53e47ee39ee47a91975563c0a16298637ba17acaf0a64e7","observation_id":"ab5064c3-2b99-465c-9b1d-573ff2ac0daf","resolution":{"observed_at":"2026-08-06T05:44:16.353804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.334462Z","title":"Exploration by random network distillation","venue":null,"work_id":"ddc8470e-e633-42a3-b744-5589ddf6460f","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.800901Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:66dd5c2e8077a56ec61bc721cb2215531063c5e1552fd4d2dc1e8fb124c7c3be","observation_id":"d30659ea-1eab-48c2-b419-4031954f0126","resolution":{"observed_at":"2026-08-06T05:44:16.339315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.318740Z","title":null,"venue":null,"work_id":"0f46e867-9f76-4bd9-bcf7-e3c51bf76d7a","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:12.940884Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:e83ef5c3123b099f3ab036431a018181d4e66bc5cd4036818fdf28fb2b85b78f","observation_id":"8f07d446-0420-4b67-8e80-e72e1a969202","resolution":{"observed_at":"2026-08-06T05:44:16.323706Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02628","last_updated":"2022-05-03T14:08:13Z","snapshot_observed_at":"2026-08-06T14:09:00.518407Z","submitted_at":"2022-03-05T00:54:58Z","title":"Target Network and Truncation Overcome The Deadly Triad in $Q$-Learning","version":2},"cited_work":{"arxiv_id":"2203.02628","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.02628","snapshot_observed_at":"2026-08-06T05:44:15.469375Z","title":"Target Network and Truncation Overcome The Deadly Triad in $Q$-Learning","venue":"cs.LG","work_id":"06a3d506-d2bd-4b28-bfb1-39862c6fa8ec","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.114051Z"},"links":{"cited_paper":"/paper/2203.02628","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f5bd265aa3fea06d3b4115267764be9a73f9f205692c6b48e2f26e36abe4a09b","observation_id":"03652976-be24-49f7-bf0e-8ecf3ab81883","resolution":{"observed_at":"2026-08-06T05:44:15.474846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.302972Z","title":"Phasic policy gradient","venue":null,"work_id":"e6775934-613d-4457-8f90-53286e2e408d","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.226971Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:c2cbadb1443c5d4c6f99044051bdad5e2b12dd242a57ff8574517626b8aa4089","observation_id":"b52edd0c-0814-40e9-be24-7cde3cdbe10e","resolution":{"observed_at":"2026-08-06T05:44:16.308603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.284940Z","title":"Loss of plasticity in deep continual learning","venue":null,"work_id":"ff969776-be3a-4ce2-9689-55aa8ad301cc","year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.362972Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:d87419b42db15ff8073934881894d9e1a63713bedb5a3805888470fde42d1bab","observation_id":"88de9485-13b4-4789-8f86-17fa6b062881","resolution":{"observed_at":"2026-08-06T05:44:16.291200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.268276Z","title":"Stop regressing: Training value functions via classification for scalable deep RL","venue":null,"work_id":"8ddb187a-2171-4eb2-9213-49361afcf21a","year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.464882Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:4aa5ad7b2ca83d8c73d13126ce5ec2e2f23c8c05eaaf83582a65d337ef86c6f8","observation_id":"5a1084c3-0b78-49f7-b3a2-86d547419461","resolution":{"observed_at":"2026-08-06T05:44:16.273604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.252721Z","title":"Fujimoto, H","venue":null,"work_id":"b1ff6bd2-7a0e-4193-bb98-b505bbcb71a1","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.647048Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:ded7012d5d4a01dfe9a51c24ff69760463c22d0db6f1729f92e32b782ee98ffb","observation_id":"5ec7e74d-589f-4bf7-8881-693668b66d7b","resolution":{"observed_at":"2026-08-06T05:44:16.257618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04034","last_updated":"2024-11-06T16:32:40Z","snapshot_observed_at":"2026-08-09T11:24:33.363238Z","submitted_at":"2024-11-06T16:32:40Z","title":"Non-Stationary Learning of Neural Networks with Automatic Soft Parameter Reset","version":1},"cited_work":{"arxiv_id":"2411.04034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04034","snapshot_observed_at":"2026-08-06T05:44:15.445876Z","title":"Non-Stationary Learning of Neural Networks with Automatic Soft Parameter Reset","venue":"cs.LG","work_id":"399d873d-1d91-4835-971f-fae5170e32f9","year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.757638Z"},"links":{"cited_paper":"/paper/2411.04034","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:8e7dea4dbd5f2a95b129195628f40432d08553d1611e87420b5e86c3849b63b9","observation_id":"40ed1020-c78a-49f5-b408-d40e0818c4a5","resolution":{"observed_at":"2026-08-06T05:44:15.452859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.237431Z","title":"Improving performance in reinforcement learning by breaking generalization in neural networks","venue":null,"work_id":"efe37688-1211-4823-9f7a-e4b14c120c6f","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:13.931406Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:5c2d6d59ea76dd20715f66da278afac777cc7b9a5bde61edb37bcf2856ed13f7","observation_id":"0a9231d9-a5f3-4db5-9681-80aabfe18382","resolution":{"observed_at":"2026-08-06T05:44:16.242508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.219466Z","title":"Haarnoja, A","venue":null,"work_id":"824aaecf-a44a-484b-9e75-7d6e5301457e","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.108446Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f10de845557cf8a6a6bad986170547223cead5a28d4cedfb6d084659b82efea7","observation_id":"398644d4-ff48-4007-b3e2-65ca964f6c89","resolution":{"observed_at":"2026-08-06T05:44:16.224251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.203188Z","title":"Temporal difference learning for model predictive control","venue":null,"work_id":"cebec88d-8cbe-4607-b7a8-59c86e82c55b","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.243178Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:1a999e3509a64a5bea3eeeb6bea1d0d90f1a4a565c6324c8bac05e143ca43af0","observation_id":"3c9e5f52-3bf3-4823-b7ec-01384df6b968","resolution":{"observed_at":"2026-08-06T05:44:16.208501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.185838Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"7a705b5f-2cd8-43fa-a8a1-94421fb7d1e9","year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.406629Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f60452d694c4512dbd9a77ccaeb3772e654ce5ac16e2166bd0b913ceb3016280","observation_id":"db07826b-be36-4c5a-baa9-4954c7e2210d","resolution":{"observed_at":"2026-08-06T05:44:16.191803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.169629Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":"7618c6d7-88d9-4c6d-8b92-93a4c1996aa4","year":2002},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.537137Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:db4165812b2b2e4ef32401a014c597765e99f2b28912298f97cca68a2f4de817","observation_id":"db39975b-1a29-41ba-870f-2a6b4559fffe","resolution":{"observed_at":"2026-08-06T05:44:16.174366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.152172Z","title":"Discor: Corrective feedback in reinforcement learning via distribution correction","venue":null,"work_id":"badcc243-1ffd-4df3-8cda-f1f10e7a871a","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.662962Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:a97698a59105c86fa2cdf99ad239056ddc39240e21ae5bde83629f765393dc40","observation_id":"8e9f4d0f-9c87-423d-80bf-f327d0e7ff56","resolution":{"observed_at":"2026-08-06T05:44:16.158893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.136124Z","title":null,"venue":null,"work_id":"b0b4967a-082b-4c54-a9af-c8cf3cb798a3","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.793980Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:c173b4e6cb131974a037e1e0abbb14438c7c6b8f88ad00382e49f3856af13a5c","observation_id":"86f10e3c-19d3-43be-831d-836dc2b3b1bb","resolution":{"observed_at":"2026-08-06T05:44:16.141186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.119644Z","title":"Maxmin q-learning: Controlling the estimation bias of q-learning","venue":null,"work_id":"2d1eed29-28a0-475f-bb98-99905df3b8ae","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:14.974012Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:8761c5e376e04ef12d72e88cde5c861afa1dce3a446e896850eb7123a9b4b73a","observation_id":"b9d82107-e6cb-4913-ae78-48ec50239c3b","resolution":{"observed_at":"2026-08-06T05:44:16.125073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.102952Z","title":"Optidice: Offline policy optimization via stationary distribution correction estimation","venue":null,"work_id":"0012ccb2-cca5-4d4a-b525-806cdab90c53","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.071409Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:4cd003a3ffe9bfb5fb24c7ef895aac499ba027f8d78256740755fbd41997647e","observation_id":"0d0b4467-759a-436b-bcc0-6d29e243fd3c","resolution":{"observed_at":"2026-08-06T05:44:16.108519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.087332Z","title":"Hyar: Addressing discrete-continuous action reinforcement learning via hybrid action representation","venue":null,"work_id":"93df60f1-de3e-497f-936f-6b31cb188fd7","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.090226Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:c4a0160fa21ad9d69fcf4ed118a0bfba5875866bdb6ca40fa0639a8fda58dbd4","observation_id":"a9e2609a-7fab-4c54-b406-4663a7ae6527","resolution":{"observed_at":"2026-08-06T05:44:16.092348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.071651Z","title":null,"venue":null,"work_id":"1541ac78-487a-4e10-91d9-951549792364","year":2015},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.102829Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:71f66298d5cd9079db581c465064403238da7368e02bd8190085e96b1fb577b1","observation_id":"02bf594d-fa09-4e4c-89fa-1bd7856647a7","resolution":{"observed_at":"2026-08-06T05:44:16.076826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.055697Z","title":"Understanding plasticity in neural networks","venue":null,"work_id":"fe47f637-a1f2-419b-9669-e556012a49fb","year":2023},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.107894Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:bd7bce28ba5b7537d797109107530603b475c74856967f99f53dbd3108b69fab","observation_id":"692c1348-e985-40f7-b5ff-a4ec1e411a5d","resolution":{"observed_at":"2026-08-06T05:44:16.060939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01800","last_updated":"2024-07-01T20:58:01Z","snapshot_observed_at":"2026-08-09T13:47:24.153200Z","submitted_at":"2024-07-01T20:58:01Z","title":"Normalization and effective learning rates in reinforcement learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01800","snapshot_observed_at":"2026-08-06T05:44:15.112426Z","title":"Normalization and effective learning rates in reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.112426Z"},"links":{"cited_paper":"/paper/2407.01800","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7edf6648f8b70d8555069d2b66a460226d7caac54e7a1590c30f12a684658437","observation_id":"296b198c-6a76-4466-a25c-824730fbc677","resolution":{"observed_at":"2026-08-06T05:44:15.112426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.117368Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.117368Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:1805c4fb184b97de1129a44cdb7f86e5bd1cca9be9287f9abe6e31eca451b281","observation_id":"5c2f20bc-4c50-40a8-bf90-2a42869a932b","resolution":{"observed_at":"2026-08-06T05:44:15.117368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-05T10:28:32.357062Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-06T05:44:15.122140Z","title":"Algaedice: Policy gradient from arbitrary experience","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.122140Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:5a66a54581e03f7a857bac2f13064bc2b508d122fb8d728539516ed849dff99f","observation_id":"8a11509c-8cd1-46bb-8bef-8b133a160193","resolution":{"observed_at":"2026-08-06T05:44:15.122140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16158","last_updated":"2024-12-03T08:42:49Z","snapshot_observed_at":"2026-08-07T12:11:17.938787Z","submitted_at":"2024-05-25T09:53:25Z","title":"Bigger, Regularized, Optimistic: scaling for compute and sample-efficient continuous control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16158","snapshot_observed_at":"2026-08-06T05:44:15.127132Z","title":"Bigger, regularized, optimistic: scaling for compute and sample-efficient continuous control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.127132Z"},"links":{"cited_paper":"/paper/2405.16158","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:bf21c92466a194d4e5e219f209f854448d617189e0afa11564c67375ee493778","observation_id":"64d31f03-dd55-440d-a529-5d9f1229d620","resolution":{"observed_at":"2026-08-06T05:44:15.127132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.027333Z","title":"Nikishin, M","venue":null,"work_id":"979dcc8a-4057-4a92-8fe6-579b0249b3f4","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.132767Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:d7ed4e918cae604c2b495a34342574a8a9c0f4ce0658428dbf052f80c8255982","observation_id":"73c79c66-b119-417c-b4b2-d90458ca0b5e","resolution":{"observed_at":"2026-08-06T05:44:16.032454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08609","last_updated":"2024-06-26T16:50:01Z","snapshot_observed_at":"2026-08-06T08:46:28.213785Z","submitted_at":"2024-02-13T17:18:56Z","title":"Mixtures of Experts Unlock Parameter Scaling for Deep RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08609","snapshot_observed_at":"2026-08-06T05:44:15.137915Z","title":"Mixtures of experts unlock parameter scaling for deep RL","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.137915Z"},"links":{"cited_paper":"/paper/2402.08609","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:45a2ea8b3a14f7fcbabb27b649b830c9fdcf9dafdf1694fa882752979ec1d681","observation_id":"49e4a198-8e23-4210-a2a6-6a14c665cb30","resolution":{"observed_at":"2026-08-06T05:44:15.137915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:16.012146Z","title":"Chatgpt: Optimizing language models for dialogue, 2022","venue":null,"work_id":"92350f44-b9c0-4a69-87e4-6439d05c98da","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.142696Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:07692e572abcad82284655282af5c2e040efdb482f9c850bf870b9ac1184a0bc","observation_id":"befae0ed-fecd-4bb2-92b0-127d5f9bb8d5","resolution":{"observed_at":"2026-08-06T05:44:16.016932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.997358Z","title":"Dota 2 with large scale deep reinforcement learning","venue":null,"work_id":"b434835b-87b9-4f4d-8754-9ce0a52281d7","year":2019},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.147758Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:441e6fd30fcb943a5551809e78c0e5540bdc7095c679878e91d15b1891c9ce0f","observation_id":"83f468a9-7d71-4521-bab2-62eb0ccd4f4b","resolution":{"observed_at":"2026-08-06T05:44:16.002008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.982327Z","title":"Bellemare, Aaron van den Oord, and Remi Munos","venue":null,"work_id":"645a6548-d0bc-4b78-86c7-723de0a644ce","year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.152329Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f818cf060f095034f6844df3df09787a08e47d0553c1845262da3c9f597e08c0","observation_id":"6c23f6f7-da7b-4a29-bff5-dd379dde39c9","resolution":{"observed_at":"2026-08-06T05:44:15.987483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.967484Z","title":"The difficulty of passive learning in deep reinforcement learning","venue":null,"work_id":"596b875f-362b-490f-9b10-08ff5bdabf0c","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.157046Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:9f7ff129f0be50f42d70bb58dad2a54ff874280bff2f0a103148110f811a6854","observation_id":"042f1dbe-316a-4063-aabf-d0de3c46f816","resolution":{"observed_at":"2026-08-06T05:44:15.972739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.951316Z","title":"Jha, Toshisada Mariyama, and Daniel Nikovski","venue":null,"work_id":"42b01ce1-dc59-4416-b3cd-739853c47bae","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.161903Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:d4935f90800acca5d84be5f83d7aace2ebfffe6a4afaece3e28f31ebd2c1c2f6","observation_id":"d0ae13c7-9db3-427e-84c4-660e1cd560dd","resolution":{"observed_at":"2026-08-06T05:44:15.956169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.936235Z","title":"Fuzzy tiling activations: A simple approach to learning sparse representations online","venue":null,"work_id":"888e2e82-9837-4efc-a370-eaf60ebebabb","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.167501Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:378c8983c01ef14db54357e032953e7444188f182ad388fde39fc45cbc88e040","observation_id":"34226b10-1c78-4dad-a4a4-e40eae71538b","resolution":{"observed_at":"2026-08-06T05:44:15.940986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.921314Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":"190658df-d6f5-405e-b059-3b3d13035c37","year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.172719Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:3d7211cdc166092da540f747e2631766877fa15f6d7bd5117733f904df2bb6ff","observation_id":"eb97cefc-621b-43d2-a46e-78438b04dc6c","resolution":{"observed_at":"2026-08-06T05:44:15.926529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.904643Z","title":"Bridging the gap between target networks and functional regularization","venue":null,"work_id":"09535427-d77f-4b58-9e44-280afc2eeb81","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.179837Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:b41c200c5c2dabf31db7b9fe1af7e2b6b3c6b5341aa4aaa3fc442d49844ea0fc","observation_id":"3f8cf745-15fe-495c-8866-5c74e443db44","resolution":{"observed_at":"2026-08-06T05:44:15.909906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.890665Z","title":"Decoupling value and policy for generalization in reinforcement learning","venue":null,"work_id":"ee8cf939-858e-426c-ab26-a3bc47affc7c","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.185252Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:dc0c8482c9ab77e91ee53febf974415a6b136789695e0eea492ba639109cc4e3","observation_id":"d6832d5f-b75a-401a-b8b8-187ff913c706","resolution":{"observed_at":"2026-08-06T05:44:15.895196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.875627Z","title":"Prioritized experience replay","venue":null,"work_id":"9fb71e1d-3b53-44b2-b66b-685a51014a0c","year":2016},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.190676Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:d1e9bb622c542f88d8aae4caef6299a29c02e3706c191f4dfbecc28c77ce4d5d","observation_id":"b7edd74f-59f8-414a-98b4-47d23bbb7de1","resolution":{"observed_at":"2026-08-06T05:44:15.880540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.859680Z","title":"Schulman, S","venue":null,"work_id":"4606d7e8-1cd1-4c60-9f68-85dd4c8130dc","year":2015},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.196969Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:25771f0c18cc54b237a5dbf96095609ad2350bdbb95936e26ea35353e46fefa1","observation_id":"9c29176a-8c64-4fbb-8bf2-d94bd3197d30","resolution":{"observed_at":"2026-08-06T05:44:15.864276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T05:44:15.201847Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.201847Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:982e732955879ba72f3efc6a74e5d94b4993bb4aaa729014dcb6f1bc55d86319","observation_id":"baeb9d29-7246-4a99-ba62-f1f95bb9e9ef","resolution":{"observed_at":"2026-08-06T05:44:15.201847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.844622Z","title":"Courville, Marc G","venue":null,"work_id":"878b6798-4354-459a-9df4-db06208dc8db","year":2023},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.206930Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:9ce0f8404338ffa0364d6876c262050028197d9dfe3fb19096a1f97c89d30275","observation_id":"339911d0-db30-44f0-a4ee-5bfce67c664a","resolution":{"observed_at":"2026-08-06T05:44:15.849518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.829170Z","title":null,"venue":null,"work_id":"ea5850be-7381-40aa-b78c-0aadb1645d96","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.212085Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:5df5c67dfe6cec2fb6e75675c0745271097dadff4021169f69501645c4c50203","observation_id":"0fce935c-1f8c-41d6-b479-817a1160e7f8","resolution":{"observed_at":"2026-08-06T05:44:15.834305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.813001Z","title":"\\#exploration: A study of count-based exploration for deep reinforcement learning, 2017","venue":null,"work_id":"149cd84d-29d8-4c51-8fdf-c57da196242f","year":2017},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.216775Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:511b6b8055af820b4774cdca77494a1d94be72454c9267ad6c8bf68809455ff2","observation_id":"f803f178-40de-4eb6-b7de-bdb65e7ad3b7","resolution":{"observed_at":"2026-08-06T05:44:15.817834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.796941Z","title":"Improving deep reinforcement learning by reducing the chain effect of value and policy churn","venue":null,"work_id":"f06148f5-7870-4a1d-a5f5-f64f0be02fd1","year":2024},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.221980Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:a27a68602aac29a0cac549111657af63c3639dae590f59d60ab05b95d7df4e41","observation_id":"b5bdd617-acf5-4402-9c79-250644d4e6ae","resolution":{"observed_at":"2026-08-06T05:44:15.802566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.227056Z","title":"Temporal difference learning and td-gammon","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.227056Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:b287718779fbbf33d9c9adf3723cd2d9ebba1cd540360137b70412124fc73141","observation_id":"b92963fa-2d7e-45e5-8748-23f0767b9695","resolution":{"observed_at":"2026-08-06T05:44:15.227056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.232608Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.232608Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:ac28476fd3cae9b7dfe470550328522aa87693eba10be2b17a56957d36b0cf98","observation_id":"39dc3e1e-6ffe-45ae-b113-8b0222107181","resolution":{"observed_at":"2026-08-06T05:44:15.232608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-06T05:44:15.237995Z","title":"Deep reinforcement learning and the deadly triad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.237995Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:2f7c586d61abfb100e44f1d1a8879a5dae344ca7def81958ab82c545cfa516d2","observation_id":"4d54ad17-5829-4f9c-a0f1-9b53f8d0d437","resolution":{"observed_at":"2026-08-06T05:44:15.237995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.760852Z","title":"Overcoming the spectral bias of neural value approximation","venue":null,"work_id":"ac7340b1-01d4-4e41-9d89-55d90d3be47d","year":2022},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.242757Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:6d93f937694a0f1e7c920490439f50ece1ea634b092501b25902023e7dad20c6","observation_id":"4711cce7-329c-4425-8ae4-aac846a25fca","resolution":{"observed_at":"2026-08-06T05:44:15.766412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.744623Z","title":"MinAtar : An atari-inspired testbed for thorough and reproducible reinforcement learning experiments","venue":null,"work_id":"97d593fe-25e3-408e-b0a3-a7fd499a3e92","year":2019},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.247375Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:5a465a5f7df9b9c47f9e53b8b3b0f38f9d879eb7e11cb10584c76a72ad5357a9","observation_id":"ac19e42c-0955-4e59-9db1-4a4516f45894","resolution":{"observed_at":"2026-08-06T05:44:15.749648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.729845Z","title":"Learning invariant representations for reinforcement learning without reconstruction","venue":null,"work_id":"aabc182a-86b9-400e-9041-86966291c3b8","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.251844Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f1bc09f87974a05c2a2c0038bfc8fa88b42d2429ac55b9c9178ff32ecff266f7","observation_id":"60d6ec9f-97b9-48af-8fe1-a0a208a49cc9","resolution":{"observed_at":"2026-08-06T05:44:15.734634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.714546Z","title":"Gendice: Generalized offline estimation of stationary values","venue":null,"work_id":"978f17dd-329e-4e49-934c-fa547b5a5600","year":2020},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.256785Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:786872b2b1602dbfa7983418410168dad4a4e608f05a990a778106b6836ac700","observation_id":"fdbd5858-aa05-4113-a705-2a16f45e2761","resolution":{"observed_at":"2026-08-06T05:44:15.719434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.699345Z","title":"Breaking the deadly triad with a target network","venue":null,"work_id":"f0862ae3-7710-4965-8b28-016eef9084ba","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.262635Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:f1cc0d8a60d656f531e62cc5dc88b2073950d6e2664a7aef1c29ea39cf29ea15","observation_id":"719dedf7-6b7d-4556-ad52-758912305210","resolution":{"observed_at":"2026-08-06T05:44:15.704127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08621","last_updated":"2020-12-15T21:26:54Z","snapshot_observed_at":"2026-08-07T10:57:14.912412Z","submitted_at":"2020-12-15T21:26:54Z","title":"BeBold: Exploration Beyond the Boundary of Explored Regions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.08621","snapshot_observed_at":"2026-08-06T05:44:15.267730Z","title":"Bebold: Exploration beyond the boundary of explored regions","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.267730Z"},"links":{"cited_paper":"/paper/2012.08621","citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:a4f53fdba888701574c63846ad604e830ecc576df8d7bab8ac362b32a0455cd8","observation_id":"76405fa5-0000-4990-93c4-51b2eff046fd","resolution":{"observed_at":"2026-08-06T05:44:15.267730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.684169Z","title":"Noveld: A simple yet effective exploration criterion","venue":null,"work_id":"958a49c6-904d-4147-a785-804c6679d393","year":2021},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.273651Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:7ebd2c7bc6836ddd64d4aa7a91fa79438abadcb177174e7631cc0d2d57e5ef5a","observation_id":"d4bfed1c-e7c4-4ae2-8c29-abd91c3ee521","resolution":{"observed_at":"2026-08-06T05:44:15.689132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.279905Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.279905Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:6a88587599be2244a24e6cd6051dbc5c52d639a78acb77ef500e65c9accce6d5","observation_id":"3ac185bc-b5ee-42b2-a8b6-661b1dc03eea","resolution":{"observed_at":"2026-08-06T05:44:15.279905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.285200Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.285200Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:93dca1d8e8db51c0f9f97e99dd5d6b457ccd3ce915692e71a4eab498ecd81dfa","observation_id":"2de190b9-18af-4c9c-a78a-2fde7f7fe7d6","resolution":{"observed_at":"2026-08-06T05:44:15.285200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:44:15.648685Z","title":null,"venue":null,"work_id":"6b92d3c5-993c-4f1f-a749-5d2bcfaa38e9","year":2025},"citing_paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T05:44:15.289881Z"},"links":{"citing_paper":"/paper/2508.01329"},"observation_digest":"sha256:fcf3074039f7537c1071a8ac33c1d84e1c7eb1eaca740989f7b016bf54a5b6b1","observation_id":"b258ad46-e590-4175-8533-77a1ac54c371","resolution":{"observed_at":"2026-08-06T05:44:15.653607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.01329","last_updated":"2025-08-02T11:40:26Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T13:48:07.874471Z","submitted_at":"2025-08-02T11:40:26Z","title":"Is Exploration or Optimization the Problem for Deep Reinforcement Learning?"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":43},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2508.01329."}