{"as_of":"2026-08-14T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fabc390537d2b4480ac6c2a6f245979d7e7bae077cdc2ab99f1bf024a5cf22a8","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:50.823234Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05716/citation-record","integrity":"/paper/2506.05716/integrity","json":"/paper/2506.05716/citation-record.json","paper":"/paper/2506.05716"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.906077Z","title":"Averaged-dqn: Variance reduction and stabilization for deep reinforcement learning","venue":null,"work_id":"87b074cc-6109-4c86-b7fd-f8ecf3c3ee41","year":2017},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:47.898294Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:8d3c9ec7cd659d64a56771686eb2a1e629378de734a1637a87c093718811c4a2","observation_id":"33b4becb-6c3c-484f-b044-5671c5f06bac","resolution":{"observed_at":"2026-08-07T10:18:56.131377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14488","last_updated":"2023-05-02T23:44:10Z","snapshot_observed_at":"2026-08-13T14:17:19.282381Z","submitted_at":"2022-09-29T00:42:44Z","title":"Ensemble Reinforcement Learning in Continuous Spaces -- A Hierarchical Multi-Step Approach for Policy Training","version":2},"cited_work":{"arxiv_id":"2209.14488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14488","snapshot_observed_at":"2026-08-07T10:18:51.686566Z","title":"Ensemble Reinforcement Learning in Continuous Spaces -- A Hierarchical Multi-Step Approach for Policy Training","venue":"cs.LG","work_id":"4f632d79-9d19-419a-85c6-3879eacc31d6","year":2022},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.008298Z"},"links":{"cited_paper":"/paper/2209.14488","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:f8bd252411b838ac69c8e35b151b138660f8484ab8883f2b2942c1215ec5c8aa","observation_id":"bcf78f58-43f0-4ac9-b332-8160d5e4c52d","resolution":{"observed_at":"2026-08-07T10:18:51.769542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.504866Z","title":"Mushroomrl: Simplifying reinforcement learning research","venue":null,"work_id":"d75ad04f-5c48-4988-881d-00e2040013e1","year":2021},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.186274Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:5b1a57f41a1bc131bf0f37de685a2c3258a926dc40c22b2f13a18c7e255faf09","observation_id":"14e3c160-e51c-4969-9fc3-440e199c68fb","resolution":{"observed_at":"2026-08-07T10:18:55.709013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:55.161789Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"2b8d7b7b-3bd9-4af7-b3fb-890bf3e6093c","year":2018},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.367202Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:e12ea5305bbf72aab82ae588380026b5902e78d9347e2dd9479e1f092cb3e9ef","observation_id":"2b222622-40b9-4bb9-8135-53c5aa2cfb3b","resolution":{"observed_at":"2026-08-07T10:18:55.310590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07510","last_updated":"2019-02-07T22:11:51Z","snapshot_observed_at":"2026-08-08T23:54:18.549310Z","submitted_at":"2019-01-22T18:38:04Z","title":"Understanding Multi-Step Deep Reinforcement Learning: A Systematic Study of the DQN Target","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07510","snapshot_observed_at":"2026-08-07T10:18:48.523669Z","title":"Understanding multi-step deep reinforcement learning: A systematic study of the dqn target","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.523669Z"},"links":{"cited_paper":"/paper/1901.07510","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:b8485f6f45d34002a4cc9731a8f52d819c80719c8870e74ac8f2a6c3a4ae2a59","observation_id":"b62061ba-c9dd-42b8-aaed-bf34cb00963d","resolution":{"observed_at":"2026-08-07T10:18:48.523669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.701384Z","title":"Wd3: Taming the estimation bias in deep reinforcement learning","venue":null,"work_id":"c2dcb7a6-80bd-4836-911d-58117ffa7a73","year":2020},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.656883Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:067fb483571c08ee25266563ece426436049d46eb3a0f4a5ad4d4ba7562cfca2","observation_id":"174abb56-8cf2-45ff-ad77-9f6507898be5","resolution":{"observed_at":"2026-08-07T10:18:54.888632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.373147Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":"67c8592b-a810-4d2c-81c1-8eadde489769","year":2018},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.816458Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:1c0c6fc25f86605104f4ace8c0ea1e822daf93cf7cdb73d17da9bf3167ba678a","observation_id":"f2c2aaa1-ae24-4f13-9962-2d9aa4d8231a","resolution":{"observed_at":"2026-08-07T10:18:54.553122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:54.057902Z","title":"Bring color to deep q-networks: Limitations and improvements of dqn leading to rainbow dqn","venue":null,"work_id":"f09b18a8-6df3-40e9-9c97-9e19108a5296","year":2021},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:48.972152Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:12ca0d0f2df36d90cd3844b3c9382e18ed135385c678ebd39b24163fe685d093","observation_id":"bfd774fa-c87d-4041-852c-1d176ad83b9c","resolution":{"observed_at":"2026-08-07T10:18:54.200244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.820497Z","title":"Elastic step ddpg: Multi-step reinforcement learning for improved sample efficiency","venue":null,"work_id":"41561a54-bb18-4883-a4e1-654baf8e53c2","year":2023},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.072592Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:adab24e8b1b9231ec38250dcc6d8b6e96ab594d5cacce23625a284e635ee13fe","observation_id":"46c982f7-5272-484e-986c-c405eddb4eb8","resolution":{"observed_at":"2026-08-07T10:18:53.967998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.419199Z","title":"Elastic step dqn: A novel multi-step algorithm to alleviate overestimation in deep q-networks","venue":null,"work_id":"300b8e91-372d-4b0f-ab55-ff66a9c73f3f","year":2024},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.251341Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:d4c21cfa2a650d687a3e07b2b52157e99e4bb90927d13efc01e76f1ea196b621","observation_id":"2b808023-ad6d-4c8d-86c8-875a23d6a104","resolution":{"observed_at":"2026-08-07T10:18:53.652559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06487","last_updated":"2021-08-07T18:51:37Z","snapshot_observed_at":"2026-08-08T20:16:19.069312Z","submitted_at":"2020-02-16T02:02:23Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06487","snapshot_observed_at":"2026-08-07T10:18:49.430393Z","title":"Maxmin q-learning: Controlling the estimation bias of q-learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.430393Z"},"links":{"cited_paper":"/paper/2002.06487","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:807725ea04ab83f3fa1cf9c69cd82d7e27a696803c2e3f4640695219bd3e3a73","observation_id":"9086a3f5-1f5e-405f-a0a9-1042649faf05","resolution":{"observed_at":"2026-08-07T10:18:49.430393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:53.126382Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"365d4c8f-a5ea-43f6-8b77-24028746f81b","year":2015},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.568478Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:986163f6b20678a570e9aea0ab000422092058a877ee3cc7d0d4758dd874f8a6","observation_id":"78c45b44-0ade-4be2-9f43-d2709e2006af","resolution":{"observed_at":"2026-08-07T10:18:53.280170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00514","last_updated":"2024-06-19T11:32:01Z","snapshot_observed_at":"2026-08-13T04:05:37.530811Z","submitted_at":"2024-03-01T13:25:10Z","title":"Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00514","snapshot_observed_at":"2026-08-07T10:18:49.734756Z","title":"Overestimation, overfitting, and plasticity in actor-critic: the bitter lesson of reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.734756Z"},"links":{"cited_paper":"/paper/2403.00514","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:0a250a78381beaa637fec0d0123c93ee251436a04346b59b527c0e407df97406","observation_id":"77e2d3d5-0248-4d0c-98b1-276b66674e6a","resolution":{"observed_at":"2026-08-07T10:18:49.734756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.14826","last_updated":"2021-05-21T19:53:36Z","snapshot_observed_at":"2026-08-12T01:13:34.894520Z","submitted_at":"2020-11-20T15:23:40Z","title":"Revisiting Rainbow: Promoting more Insightful and Inclusive Deep Reinforcement Learning Research","version":2},"cited_work":{"arxiv_id":"2011.14826","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.14826","snapshot_observed_at":"2026-08-07T10:18:51.295413Z","title":"Revisiting Rainbow: Promoting more Insightful and Inclusive Deep Reinforcement Learning Research","venue":"cs.LG","work_id":"b5bc0ead-f9f4-4d51-be44-db81668ca66d","year":2020},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.846485Z"},"links":{"cited_paper":"/paper/2011.14826","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:69cf3cf990b3e9c9298ba1b0feae5d5390b91c80006007592d456bee1616aaba","observation_id":"f35cc21c-bff7-485b-ae2e-f58f3538ba08","resolution":{"observed_at":"2026-08-07T10:18:51.461428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.860826Z","title":"Issues in using function approximation for reinforcement learning","venue":null,"work_id":"7ec99fbf-f370-47bf-a37a-fee729cbec3c","year":1993},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:49.976666Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:325b6cde879b2fe46ba63cde514052b24ae77e2e81302275951834e92aaa1216","observation_id":"e5634b6a-8ec5-4164-aa8e-5ebcbc7f9d8e","resolution":{"observed_at":"2026-08-07T10:18:52.984969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-08-10T12:35:10.713462Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-07T10:18:50.077455Z","title":"Deep reinforcement learning and the deadly triad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.077455Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:06b358d68b3ecc242bb2b00b62bb471dbe6740a44127d1284def8f06eed92ccb","observation_id":"ba0a0d1d-eb7c-4e1d-bf74-8d37a9cbc8e3","resolution":{"observed_at":"2026-08-07T10:18:50.077455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.570978Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"78f5be04-0fd2-474a-b061-d6cc362b6553","year":2016},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.210042Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:51fd1293352670c35d2028dfad5db680529ea4563575cf601d2a80840b7988f1","observation_id":"299c696d-4d85-414d-a6f9-e422f2d815ce","resolution":{"observed_at":"2026-08-07T10:18:52.691097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:52.258582Z","title":"Controlling underestimation bias in reinforcement learning via quasi-median operation","venue":null,"work_id":"3ca1c26d-de8f-4c15-b175-57c7259cae55","year":2022},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.365061Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:8bd76172a6aff7502478ece5674e9bdb02cdd9de8589ed866204cee5dfc38144","observation_id":"137e1cfe-eb05-4c37-9e30-8732445e98ce","resolution":{"observed_at":"2026-08-07T10:18:52.398852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.03176","last_updated":"2019-06-07T00:36:50Z","snapshot_observed_at":"2026-08-14T08:14:59.465594Z","submitted_at":"2019-03-07T20:34:36Z","title":"MinAtar: An Atari-Inspired Testbed for Thorough and Reproducible Reinforcement Learning Experiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.03176","snapshot_observed_at":"2026-08-07T10:18:50.501864Z","title":"Minatar: An atari-inspired testbed for thorough and reproducible reinforcement learning experiments","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.501864Z"},"links":{"cited_paper":"/paper/1903.03176","citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:088ce4daa35cb001d5433b7e5065ad5f3f6987d029eb3166011fea00d7c5d7a2","observation_id":"eb2d4639-c01a-4524-8ed4-ddb292c4ae87","resolution":{"observed_at":"2026-08-07T10:18:50.501864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.942992Z","title":"A novel multi-step q-learning method to improve data efficiency for deep reinforcement learning","venue":null,"work_id":"2176b7f6-1785-4b3f-a51a-7f527b4cfdbf","year":2019},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.627750Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:d97940c037cebd65649898f0185965c78a182d055d108870cea111f39da25bad","observation_id":"a6c0836e-6e67-4db9-82e9-9a314c87e66f","resolution":{"observed_at":"2026-08-07T10:18:52.106309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.00913","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:51.064591Z","title":"beta-dqn: Improving deep q-learning by evolving the behavior","venue":null,"work_id":"d7bb8b78-a65d-4db1-b49d-385eb7a3c295","year":2025},"citing_paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:18:50.823234Z"},"links":{"citing_paper":"/paper/2506.05716"},"observation_digest":"sha256:69f705d9718eedf32d25bf3f313e8b0e166c088fcaff7ae4b93360ef9fdb7dee","observation_id":"d80f9e1b-7935-4a6e-b508-740b9734ffdb","resolution":{"observed_at":"2026-08-07T10:18:51.148670Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05716","last_updated":"2026-07-04T11:13:11Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T05:14:49.662456Z","submitted_at":"2025-06-06T03:36:19Z","title":"Ensemble Elastic DQN: A Step Dependent Ensemble Approach for Reducing Overestimation in Deep Value-Based Reinforcement Learning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":3,"verified_fuzzy":13},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2506.05716."}