{"as_of":"2026-08-17T16:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b72c47715227a8e77482cb031319bccaf9236ae7cbe77acab09f5452235e8f15","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:48:16.963053Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.08360/citation-record","integrity":"/paper/2411.08360/integrity","json":"/paper/2411.08360/citation-record.json","paper":"/paper/2411.08360"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:16.793163Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.793163Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:5124b8958c3210870e885962a1aa15cbc8b7540b9ba341db82c1a64a6d589908","observation_id":"25ddcad1-4e33-4998-b32e-9fd794e2fa47","resolution":{"observed_at":"2026-08-12T21:48:16.793163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.610888Z","title":"Reliable adaptive recoding for batched network coding with burst-noise channels","venue":null,"work_id":"2212b1b6-6560-45c6-ad39-af236e305443","year":2023},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.798009Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:10d05aee3856338a822ac632516428f2a4b4d8ebabeaf1a5cd4ec28621face20","observation_id":"e33c4ae6-81d7-4c58-90bd-503960edf392","resolution":{"observed_at":"2026-08-12T21:48:17.614969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.597502Z","title":"Markov decision processes with applications in wireless sensor networks: A survey","venue":null,"work_id":"0a858f3a-3101-48df-98f8-6e3c76a68168","year":2015},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.802596Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:cbc02465e69f0bad29cb8dcb1ec10226c8bb10b9abe14bb4e450356c5178567d","observation_id":"df5fc6d5-2f8c-4203-ad21-3b5818c1a4a2","resolution":{"observed_at":"2026-08-12T21:48:17.601632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.585549Z","title":"Q-learning algorithms: A comprehensive classification and appli- cations","venue":null,"work_id":"358601e2-bf60-48b4-8737-f80ffc02bfbb","year":2019},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.807163Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:b6fcee8278667f92b6f33706d440011a8591fcdb199b0a43bfcc65ff20fb6e14","observation_id":"8aa9d975-95bb-486c-84ea-e591686ef37a","resolution":{"observed_at":"2026-08-12T21:48:17.589829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.572678Z","title":"Q-learning: Theory and applications","venue":null,"work_id":"882a967f-dc19-46b1-bbcf-905e71b29f63","year":2020},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.811366Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:c22230d18feb24cd4cbab77f75f39d28bc3b9c925f35693e0d766da830c657d7","observation_id":"5f436d24-5220-4a6a-81ca-e70262b8f621","resolution":{"observed_at":"2026-08-12T21:48:17.577270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.560057Z","title":"Double Q-learning","venue":null,"work_id":"33f56423-d57a-46dc-b3af-c032ae9b8bad","year":2010},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.815360Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:fe6880050d09920f8d03a91be3ea5fb9e18176f1a51da2fef977f44ee359cbf6","observation_id":"9f69c23c-ae2d-45c6-a9ae-8c326e57506a","resolution":{"observed_at":"2026-08-12T21:48:17.564179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.543899Z","title":"Ensemble bootstrapping for Q-learning","venue":null,"work_id":"71f66152-4a1c-45dd-8181-faa38dc47f05","year":2021},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.819736Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:0452df0e9c352ed6c17b591290ab49d8a07b98d7163c8b9041e17bdaed494e2b","observation_id":"14c6601e-c24c-4952-8378-c58e0e32367b","resolution":{"observed_at":"2026-08-12T21:48:17.548708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06487","last_updated":"2021-08-07T18:51:37Z","snapshot_observed_at":"2026-08-08T20:16:19.069312Z","submitted_at":"2020-02-16T02:02:23Z","title":"Maxmin Q-learning: Controlling the Estimation Bias of Q-learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06487","snapshot_observed_at":"2026-08-12T21:48:16.823437Z","title":"Maxmin Q-learning: Controlling the estimation bias of Q-learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.823437Z"},"links":{"cited_paper":"/paper/2002.06487","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:e20984496206ee18396ae4ec84f3dec791d42677a864943a61f9bb5472c8ac19","observation_id":"a2fbc0ca-5be0-4711-98bd-5ba95cd1fadf","resolution":{"observed_at":"2026-08-12T21:48:16.823437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.530371Z","title":"Speedy Q-learning","venue":null,"work_id":"b3d512cd-c09b-4cb0-a8e5-90b3f0b6e360","year":2011},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.827628Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:5f399f5770d691fe7e27262c1371dd4393d722ea524ae83f98301a9c4d1e65d7","observation_id":"788b4e98-d8e9-49e1-9cde-98ff85b29814","resolution":{"observed_at":"2026-08-12T21:48:17.534597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.498809Z","title":"Pac model-free reinforcement learning","venue":null,"work_id":"952fc5ea-a155-40d1-b9b8-3815d892503c","year":2006},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.831949Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:7583a456704a65b802959dcabcf7c08fc219344349ba7b53b7312c518219060c","observation_id":"437f5186-876e-428d-ad25-e206beb3b5ae","resolution":{"observed_at":"2026-08-12T21:48:17.503165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.485781Z","title":"Neural fitted Q iteration–first experiences with a data efficient neural reinforcement learning method","venue":null,"work_id":"e65a0cfa-63aa-4518-bba9-7b91f5260485","year":2005},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.835771Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:e9e902d6687f4abf6c5d19546793222ccc2d02fbacc8f6487245952e53af469b","observation_id":"fdb3a6f6-4545-41b9-bcbd-6b76f079f28b","resolution":{"observed_at":"2026-08-12T21:48:17.490087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:16.839747Z","title":"Deep exploration via bootstrapped dqn","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.839747Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:1d13201347f5d19655dd8bd88896f04e1bdc5b1989dd97cd84387f0291206807","observation_id":"e8529386-077f-48d3-aff5-270c99a98bdd","resolution":{"observed_at":"2026-08-12T21:48:16.839747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T21:48:16.843382Z","title":"Riedmiller","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.843382Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:6a59e143e9230321478736c367a5bda8b754659617708faceaa999d8c1a3157b","observation_id":"437aba3e-ae67-4b77-9ca5-84988a9186ab","resolution":{"observed_at":"2026-08-12T21:48:16.843382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.464822Z","title":"Q-learning with linear function approximation","venue":null,"work_id":"b68f3340-48da-4767-be11-76d405ab4a9c","year":2007},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.847237Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:9401af85a55ca1fb8c0d32e4a3b2e4410953920879d3f09e241c113d14230c6a","observation_id":"93088779-e9d7-477c-9357-8f8d585e4d46","resolution":{"observed_at":"2026-08-12T21:48:17.469419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.430432Z","title":"Sample complexity of reinforcement learning using linearly combined model ensembles","venue":null,"work_id":"107644d8-158c-4edf-af1d-0face532cb91","year":2010},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.854287Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:2a8f02a5fabea2d770813e1c3d978d617b621d795cb21b8923e5d3e4a14337e2","observation_id":"c4b897ad-5a0e-468c-a703-3d727afdbec3","resolution":{"observed_at":"2026-08-12T21:48:17.438526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.10592","last_updated":"2018-10-05T05:08:37Z","snapshot_observed_at":"2026-08-14T19:41:03.980803Z","submitted_at":"2018-02-28T18:58:22Z","title":"Model-Ensemble Trust-Region Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.10592","snapshot_observed_at":"2026-08-12T21:48:16.858060Z","title":"Model-ensemble trust-region policy optimization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.858060Z"},"links":{"cited_paper":"/paper/1802.10592","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:017f51b7bfcca9aa6d66c7b67f7b6efd9166f940fcec61cecc688f43d899710e","observation_id":"2cdac10e-b52c-4cb3-aeb4-900e4b5f0a31","resolution":{"observed_at":"2026-08-12T21:48:16.858060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:16.862136Z","title":"Deep reinforcement learning in a handful of trials using prob- abilistic dynamics models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.862136Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:d9dd8eabf843c7f4346d3e710576ae425c1f9dc5bc9dc32d372af3e2e379ca76","observation_id":"9fc40cfa-629d-46e3-adf7-3a93dd311a94","resolution":{"observed_at":"2026-08-12T21:48:16.862136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:16.865881Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.865881Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:de59dba42beaf4da08d7d90f2e7a46f7a13cf9dd6dc470dda9942fb2de502d91","observation_id":"bf293276-88c3-4155-ad35-927b6832fecf","resolution":{"observed_at":"2026-08-12T21:48:16.865881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.387602Z","title":"Ensemble link learning for large state space multiple access communications","venue":null,"work_id":"7542c44c-02df-4c42-a327-403fb7bfd2b3","year":2022},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.870066Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:193e341084e8fca795de37580a07c684b8a5dc07adc7151bc3ded61dad5b0b61","observation_id":"35e61a55-621d-4e71-9e1b-795e9e89febf","resolution":{"observed_at":"2026-08-12T21:48:17.392417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.373280Z","title":"Ensemble graph Q-learning for large scale networks","venue":null,"work_id":"e93a73dd-3a20-4032-bdac-945f287da60f","year":2023},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.873712Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:eeb4a9ac1558138954381c32bf615429b5a54258122209ae83baee870e12ecda","observation_id":"f911ecda-c405-4234-bd60-bd8ea2784f04","resolution":{"observed_at":"2026-08-12T21:48:17.377898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.359021Z","title":"Multi-timescale ensemble q-learning for markov decision process policy optimization","venue":null,"work_id":"4bd73a78-a2e2-4709-b5c1-d8ae98bb10e5","year":2024},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.877389Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:537f8f7e3e5637e0482b2a3ab30acc118d39429eddd6a75646c9416a4d126ee5","observation_id":"f1f5829f-c46c-415a-9af1-6c27bc24101b","resolution":{"observed_at":"2026-08-12T21:48:17.363970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.344177Z","title":"Leveraging digital cousins for ensemble q-learning in large-scale wireless networks","venue":null,"work_id":"bf560be7-5c7e-455a-a0d0-78091d88ac88","year":2024},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.882138Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:b69b2b3c44ae6c191917a30681397cbb87a227b5d66687c6d51ccbe1509a8e14","observation_id":"c4653aeb-3949-4bef-acfc-97fae01d8eb2","resolution":{"observed_at":"2026-08-12T21:48:17.348408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.330261Z","title":"A novel ensemble q-learning algorithm for policy optimization in large-scale networks","venue":null,"work_id":"f4c640ca-eebc-4810-b76b-cf3f7496f14c","year":2023},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.885810Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:f868ebec5953bda9f8b43d0e9c19cbecd64dc5d36aa607aeb91023b453722623","observation_id":"f7c8391b-7c76-480b-a1b7-38c697c05aa4","resolution":{"observed_at":"2026-08-12T21:48:17.335126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.317912Z","title":"Link analysis for solving multiple- access mdps with large state spaces","venue":null,"work_id":"18035b15-f592-4208-8294-af6c05fa2029","year":2023},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.889556Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:cd02a2e34fbd6f2dadcaeb36091bd584a851d34b74386fe02327f04a4f115a97","observation_id":"94fe94b0-4fbe-4b16-9f65-7eb442b8d7c1","resolution":{"observed_at":"2026-08-12T21:48:17.322383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:16.893407Z","title":"Is q-learning provably efficient? Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.893407Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:382a4117ba0b5c30d81e0fa7edd16951b4053d9716a793dfb64b835aac5bc8ab","observation_id":"d3692961-f7ac-4542-aa87-34bbb7cef735","resolution":{"observed_at":"2026-08-12T21:48:16.893407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:16.897232Z","title":"Online robust reinforcement learning with model uncertainty","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.897232Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:b234f3f4f6f88e9f8cf4fa5a1f5d923dc0b51bf2ac80eced55789ebfcb333c82","observation_id":"8d6795f2-3ec8-4547-b960-5b58ae3ea6ff","resolution":{"observed_at":"2026-08-12T21:48:16.897232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.281183Z","title":"Conser- vative q-learning for offline reinforcement learning","venue":null,"work_id":"0c98337a-c685-4046-a764-eee5b5172fb0","year":2020},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.901220Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:dec432a0a6a5d3fbfa7e34b1a4a2ad3065acb4401102638fab8616349d8a6fe6","observation_id":"da4cd2ce-b9f7-437a-a4a1-ddeb4688a324","resolution":{"observed_at":"2026-08-12T21:48:17.285828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.269099Z","title":"An optimistic perspective on offline reinforcement learning","venue":null,"work_id":"bd75b775-006b-43ee-ba85-58a1f3f677f7","year":2020},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.905076Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:f586088d4120d659405d85bba557d5f6a2d7ee1ecb1e1dc2638237c42fb4314f","observation_id":"f0ea9ff9-5f10-44ff-b982-5d7ca4bfe099","resolution":{"observed_at":"2026-08-12T21:48:17.273193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.256401Z","title":"Leveraging offline data in online reinforcement learning","venue":null,"work_id":"e007c93d-f7e1-4253-bbc2-b5c1429e7c00","year":2023},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.908840Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:32c53bbd410d1534a6ac165c33a3bc2aad8fd07c02335acfab9654378064283a","observation_id":"2b6f2766-2cab-49cd-adc5-e74516f10fdb","resolution":{"observed_at":"2026-08-12T21:48:17.260691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-12T21:48:16.912632Z","title":"Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.912632Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:8548f9eee09ad228477654ff8690a99803e0d9ff4d60e58e8d0121f0b59a630e","observation_id":"1b4cfa2c-1a0c-4510-bd0b-10d85210e379","resolution":{"observed_at":"2026-08-12T21:48:16.912632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.242345Z","title":"Policy finetuning: Bridging sample-efficient offline and online reinforce- ment learning","venue":null,"work_id":"2fd2321d-9679-473b-a2f7-5dca37550132","year":2021},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.916639Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:9687557116abd7b1ddbcdf960d85282d8cb56d5e4a56e665b68e0030a06d3bc5","observation_id":"a7cf1705-e583-4563-811c-3aa513f289a5","resolution":{"observed_at":"2026-08-12T21:48:17.247073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-16T16:24:37.265288Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-12T21:48:16.920591Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.920591Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:eb3d43fd205d30c1079ea1c20061e2734b03e34bc0cb7bdd1959c11bf3500e82","observation_id":"2e6d1209-d8cc-4956-aa2c-08bc1c594bdc","resolution":{"observed_at":"2026-08-12T21:48:16.920591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.225666Z","title":"Com- paring exploration strategies for q-learning in random stochastic mazes","venue":null,"work_id":"e435135c-3b1f-4a5f-9950-cc2a7e4b792e","year":2016},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.924650Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:708f8ba22233b60ce57fb0ca25d7f258abc1d2cd7f8379c909978c45c4bfc403","observation_id":"af046d29-91fc-40f3-9395-0c54ed904789","resolution":{"observed_at":"2026-08-12T21:48:17.230930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04157","last_updated":"2022-10-09T03:50:05Z","snapshot_observed_at":"2026-08-16T16:25:49.995295Z","submitted_at":"2022-10-09T03:50:05Z","title":"The Role of Coverage in Online Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04157","snapshot_observed_at":"2026-08-12T21:48:16.928379Z","title":"The role of coverage in online reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.928379Z"},"links":{"cited_paper":"/paper/2210.04157","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:20b44be7cc9fec74664320e143e42b34060d80ea537790dd38a639e91d507342","observation_id":"b10298f2-4e93-40ef-864d-5fcf11b9e2d3","resolution":{"observed_at":"2026-08-12T21:48:16.928379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06226","last_updated":"2023-01-10T04:15:46Z","snapshot_observed_at":"2026-08-16T18:10:18.637777Z","submitted_at":"2021-07-13T16:30:01Z","title":"Pessimistic Model-based Offline Reinforcement Learning under Partial Coverage","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06226","snapshot_observed_at":"2026-08-12T21:48:16.932746Z","title":"Pessimistic model-based of- fline reinforcement learning under partial coverage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.932746Z"},"links":{"cited_paper":"/paper/2107.06226","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:f73635697fced123a313b79b07331d385eb2cde85b198fcac6f6167b77eb3b14","observation_id":"17fc7772-cfc9-4e89-83f4-c044a97f4ba1","resolution":{"observed_at":"2026-08-12T21:48:16.932746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.206006Z","title":"What can online reinforcement learning with function approximation benefit from general coverage conditions? In International Conference on Machine Learning, pages 22063–22091","venue":null,"work_id":"4f9a0d7a-33ed-42c0-bbb1-d4dd812f2de9","year":2023},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.936660Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:41533beda7e13ec55435fb3d7b8c46b8093774719c57c8a8a705c37852e7b3c1","observation_id":"0994f7b3-a7db-4031-a407-46709bcebc5f","resolution":{"observed_at":"2026-08-12T21:48:17.211572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.191807Z","title":"When to trust your simulator: Dynamics-aware hybrid offline-and-online reinforcement learning","venue":null,"work_id":"e3f969e5-38d4-4c6f-b678-e2f39c1e9c81","year":2022},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.940435Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:cd706f0b0fb12c1553691103b46c7549c86c35623262365f1a2b025c899c460d","observation_id":"14212655-35fd-4a34-ac2e-4f20997ff5ef","resolution":{"observed_at":"2026-08-12T21:48:17.196846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.169394Z","title":"Coverage analysis of multi- environment q-learning algorithms for wireless network optimization","venue":null,"work_id":"e583d63e-92c4-42ee-b586-3ef11779b571","year":2024},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.944097Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:c45c32c4d8beeff2bfb016da21c610dd80a23d5d0d5a5d0d6d6e73aa0a9645c7","observation_id":"4a951e64-b95d-4ded-a363-bd8dd1f1a35d","resolution":{"observed_at":"2026-08-12T21:48:17.174530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.150277Z","title":"Convergence of Q-learning: A simple proof","venue":null,"work_id":"30f9e4d2-795e-4ec0-b6f0-1dce70983147","year":2001},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.947548Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:f89c5de32d4d38d91b4a7973f72d63fa394f718efb0b726edc7cc29ee5e80cb1","observation_id":"62ba41a5-6357-4d1d-b602-938ee6d2ab46","resolution":{"observed_at":"2026-08-12T21:48:17.160552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.134946Z","title":"Issues in using function ap- proximation for reinforcement learning","venue":null,"work_id":"c652d509-834a-494c-9d87-bb1cebd577cd","year":1993},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.951314Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:7a71d032e09e53729673e2b6577d1af6833ee3b30b68a7787970b2c91fdc03b1","observation_id":"1afabcb6-37a8-4099-9fc0-3406415ba7bf","resolution":{"observed_at":"2026-08-12T21:48:17.140862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-08-16T18:52:10.094784Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-12T21:48:16.955046Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.955046Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:b5091ac941c1dde4fb6de85359186ebc5e8267799d9ab79394541fe20e54d668","observation_id":"244acb39-d088-4af2-aa02-2e23dee15268","resolution":{"observed_at":"2026-08-12T21:48:16.955046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:16.959107Z","title":"The virtues of laziness in model-based rl: A unified objective and algorithms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.959107Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:d20d87a5b77135e74c3ab03a36f86fbd09f98ecefe18c65a9393d16fd542c48f","observation_id":"eadff9d3-985d-40c0-8e74-1cf2992aabf5","resolution":{"observed_at":"2026-08-12T21:48:16.959107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16450","last_updated":"2024-12-30T07:35:25Z","snapshot_observed_at":"2026-08-17T12:52:02.648623Z","submitted_at":"2024-09-24T20:34:47Z","title":"A Multi-Agent Multi-Environment Mixed Q-Learning for Partially Decentralized Wireless Network Optimization","version":2},"cited_work":{"arxiv_id":"2409.16450","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16450","snapshot_observed_at":"2026-08-12T21:48:16.996689Z","title":"A Multi-Agent Multi-Environment Mixed Q-Learning for Partially Decentralized Wireless Network Optimization","venue":"eess.SP","work_id":"9bfa4db6-07ad-4da2-a2e1-3b7f7760c0bb","year":2024},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.963053Z"},"links":{"cited_paper":"/paper/2409.16450","citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:57c80452b012c1cf625e1b89d88aa562353d6ba97a36af81554a1c0c3f8f7b73","observation_id":"e72cc9b0-35ce-41e7-9d18-6532afba8694","resolution":{"observed_at":"2026-08-12T21:48:17.003329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T21:48:17.449337Z","title":"Springer, 2007","venue":null,"work_id":"ddbad23c-ebc7-46c1-b221-2fa31a9cd893","year":2007},"citing_paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning","version":1},"reference_index":2007,"source":"pdf_text","source_observed_at":"2026-08-12T21:48:16.850593Z"},"links":{"citing_paper":"/paper/2411.08360"},"observation_digest":"sha256:15241b6b309ba645826844449630fe81d49d96011aaea7c6abb9b89e0dbefe29","observation_id":"4dcbefa6-4607-4d8d-8b7f-c1537b30145f","resolution":{"observed_at":"2026-08-12T21:48:17.455306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.08360","last_updated":"2024-11-13T06:16:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T09:16:04.938042Z","submitted_at":"2024-11-13T06:16:12Z","title":"Coverage Analysis for Digital Cousin Selection -- Improving Multi-Environment Q-Learning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":28},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2411.08360."}