{"as_of":"2026-08-20T14:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15fb9d9d152893724ea73330d701c5c24a834875f05f07c1c5d5c2412d8a30f2","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:21:29.861150Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T13:11:16.568415Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T13:13:18.015262Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"cited_work":{"arxiv_id":"2505.13768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13768","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Augmenting online rl with offline data is all you need: A unified hybrid rl algorithm design and analysis","venue":null,"work_id":"18f367db-9c59-4e34-9fdd-8703051a426a","year":2025},"citing_paper":{"arxiv_id":"2605.18675","last_updated":"2026-05-18T17:15:27Z","snapshot_observed_at":"2026-08-14T05:34:25.791381Z","submitted_at":"2026-05-18T17:15:27Z","title":"COOPO: Cyclic Offline-Online Policy Optimization Algorithm","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T13:11:16.568415Z"},"links":{"cited_paper":"/paper/2505.13768","citing_paper":"/paper/2605.18675"},"observation_digest":"sha256:5baa9c3567dfb0abeafd3249ca2b2d908e3d37535072727dd7e032fa545ab67c","observation_id":"c593b69d-45c1-400a-8621-a3891331fde4","resolution":{"observed_at":"2026-05-20T13:13:18.017226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13768/citation-record","integrity":"/paper/2505.13768/integrity","json":"/paper/2505.13768/citation-record.json","paper":"/paper/2505.13768"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.242665Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.242665Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:e9102b5624eca766472209de2fa419c687b7f42bc111808f53755bfe2f3044bf","observation_id":"5c895a0b-76a4-440d-8973-a3d0e758408f","resolution":{"observed_at":"2026-08-15T20:21:29.242665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.249582Z","title":"Analysis of thompson sampling for the multi-armed bandit problem","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.249582Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:01a4f5e6bc9445ad21ba700befcfd2bfa6464ea9ce68eac1c1b8dbc9bb1d814d","observation_id":"c98ec8b3-3062-4b4e-8bd9-9074a259a4ab","resolution":{"observed_at":"2026-08-15T20:21:29.249582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.255372Z","title":"Thompson sampling for contextual bandits with linear payoffs","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.255372Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:88ae02033853dbdce5f2dc2d94094bbcd7738b4a12d2bf692de68b446b9a9d82","observation_id":"dbd2d4cd-c320-46f3-a782-489dfb43dccf","resolution":{"observed_at":"2026-08-15T20:21:29.255372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09048","last_updated":"2023-06-15T11:12:35Z","snapshot_observed_at":"2026-08-16T15:23:41.960454Z","submitted_at":"2023-06-15T11:12:35Z","title":"Optimal Best-Arm Identification in Bandits with Access to Offline Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09048","snapshot_observed_at":"2026-08-15T20:21:29.266065Z","title":"Optimal best-arm identification in bandits with access to offline data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.266065Z"},"links":{"cited_paper":"/paper/2306.09048","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:b14d58c403105a4f2403456a1117f4d83b5a2b60940458222d2090fb2e75e3b1","observation_id":"e1ed65f2-ecaa-4a58-9c66-3dbd4c185620","resolution":{"observed_at":"2026-08-15T20:21:29.266065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.274118Z","title":"Exploration--exploitation tradeoff using variance estimates in multi-armed bandits","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.274118Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:625721385845ca8f0620bb4c7690f7b06092528b7cea3eb8f223f03d360a6818","observation_id":"fb1ea420-bc2c-40a9-8b9f-0a2a64753cc7","resolution":{"observed_at":"2026-08-15T20:21:29.274118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.810417Z","title":null,"venue":null,"work_id":"6a1b67e6-77dd-4d30-8b9e-09256bed9a90","year":2002},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.279590Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:ced6d696d833437ca2d9ad3e067fc244fac8b037dc3812dde421485fa07bd60d","observation_id":"01e262d1-166e-40a0-9384-e84988a08afc","resolution":{"observed_at":"2026-08-15T20:21:31.817957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.287028Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.287028Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:bce5c575b774ec4926afe87c2b3b3bfdfcc6885878dbd24e48c7454bc8c6d153","observation_id":"b9a12319-d135-458e-9167-e33af680928d","resolution":{"observed_at":"2026-08-15T20:21:29.287028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.297657Z","title":"Stochastic linear bandits robust to adversarial attacks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.297657Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:91da5513109cd1e3b53216310fd8ff1f7b6c1b22ed22ae725cf3b831ceaeaa9f","observation_id":"f44891fb-e7aa-4523-b982-6c7d55e07e19","resolution":{"observed_at":"2026-08-15T20:21:29.297657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.749795Z","title":"Offline contextual bandits with overparameterized models","venue":null,"work_id":"8f0a2e09-d48d-40e7-a0fa-3115260accf3","year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.307453Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:41d6b455bd1a384a193bfde4c8e044d9c38f4a16521160a8ae284428b2d76a51","observation_id":"f2bb5257-693c-4215-80da-4b2166df8393","resolution":{"observed_at":"2026-08-15T20:21:31.757168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.321056Z","title":"Regret analysis of stochastic and nonstochastic multi-armed bandit problems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.321056Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:1567549d5842f902a7fe517b138245ff383fc2933ba142ddea9e1179eb01aaca","observation_id":"6f739da6-b875-4918-a870-78e524e0581b","resolution":{"observed_at":"2026-08-15T20:21:29.321056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.707878Z","title":"Kullback-leibler upper confidence bounds for optimal sequential allocation","venue":null,"work_id":"5b568277-7cc3-43b7-828b-7a939d41a373","year":2013},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.327688Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:8eab2a081867bd06dca8196b105623027ce1d2ffbc84912399d852fd73dcc910","observation_id":"92622cb2-85f6-4433-b05d-c2d61d0a5f07","resolution":{"observed_at":"2026-08-15T20:21:31.715206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.10182","last_updated":"2020-10-20T10:43:41Z","snapshot_observed_at":"2026-08-18T10:40:20.636286Z","submitted_at":"2020-10-20T10:43:41Z","title":"The Elliptical Potential Lemma Revisited","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.10182","snapshot_observed_at":"2026-08-15T20:21:29.334478Z","title":"The elliptical potential lemma revisited","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.334478Z"},"links":{"cited_paper":"/paper/2010.10182","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:fbbaafa224e2e81894eb84803aeee21319c0ecd89cdf4ae28e211c2c7a3e8adc","observation_id":"a0f51a63-b927-4230-a41c-a09f73794017","resolution":{"observed_at":"2026-08-15T20:21:29.334478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.343000Z","title":"An empirical evaluation of thompson sampling","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.343000Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:03370c3f121ebd1a9e893b8aa608ca7d00e177c03128707a5266f38e794fd255","observation_id":"e6ef10ea-4654-4bf6-880f-6913f90944ba","resolution":{"observed_at":"2026-08-15T20:21:29.343000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.350532Z","title":"Information-theoretic considerations in batch reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.350532Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:9fcf701938eb116553138c12b24a255505bff0ff6f6d0e3b17f89e957a18945f","observation_id":"49cc509e-74a7-455c-adfd-0ed56063cc20","resolution":{"observed_at":"2026-08-15T20:21:29.350532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.359279Z","title":"Leveraging (biased) information: Multi-armed bandits with offline data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.359279Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:6ef8522d93b1abbd925ba6ff1bef3455609a23b27517638ea76bf484c12e0a8b","observation_id":"c42f4de1-f0de-40c9-89d5-596efbef1efa","resolution":{"observed_at":"2026-08-15T20:21:29.359279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.367609Z","title":"Contextual bandits with linear payoff functions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.367609Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:8da7e5f0245e86bb0cb349e5500e3f2d2c465d81086ce84c7247d874eb472d29","observation_id":"0d4484bb-ebcd-47bf-ac44-dc2c28e5298d","resolution":{"observed_at":"2026-08-15T20:21:29.367609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.614564Z","title":"Stochastic linear optimization under bandit feedback","venue":null,"work_id":"29869639-b9c0-4929-85d2-5d0630916dcd","year":2008},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.375257Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:bd78a5320e903ccc32a8e2ec0a475430a03cf353642b35ad3c36e41da5131200","observation_id":"4f273f8b-d01d-4bb3-8e7c-f73427d23de8","resolution":{"observed_at":"2026-08-15T20:21:31.623429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.588757Z","title":"Minimax-optimal off-policy evaluation with linear function approximation","venue":null,"work_id":"0d1c4159-a7dd-490c-8152-f907a7f27eba","year":2020},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.381472Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:5e4eedbb2843d09e56ac6aa4ddb4cf73df8ee9eede95dada190de0dc4d5ea99b","observation_id":"04905289-db52-4afe-b818-25bbb45f9a4a","resolution":{"observed_at":"2026-08-15T20:21:31.595939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.559934Z","title":"The kl-ucb algorithm for bounded stochastic bandits and beyond","venue":null,"work_id":"0caa8e4a-e3f0-43de-aed2-4d231f681d71","year":2011},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.388370Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:a62c1fe97aa987306f85e924b4e4ff94af7705bbc74c6c5a056cfd1ca98065e7","observation_id":"010d2342-131d-49e0-8545-81ebdaab5c71","resolution":{"observed_at":"2026-08-15T20:21:31.570089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.523603Z","title":"Guidelines for reinforcement learning in healthcare","venue":null,"work_id":"711d8a13-229f-454d-b191-6ba9c137db2f","year":2019},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.396228Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:45867c8499eb3b664b5df6e9077e38ea017293cb1fca996ae436bc99d6790ea9","observation_id":"1eda491f-0c24-472c-ac81-c687a01adbb1","resolution":{"observed_at":"2026-08-15T20:21:31.534809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.404480Z","title":"The movielens datasets: History and context","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.404480Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:c5f0e0e23cd443e94b9c3b761da3b8e4e713e51e8e47d50bd16b2d144fd2ce2d","observation_id":"5ea1c3bb-61bf-45f5-b3c4-c629bc3c2ccc","resolution":{"observed_at":"2026-08-15T20:21:29.404480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.476115Z","title":"A reduction from linear contextual bandits lower bounds to estimations lower bounds","venue":null,"work_id":"cd239ff2-872d-4ee2-bcbf-2e93a6694e70","year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.416232Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:b7f073c816e519ae079c27da00fe9d396dd584da0d73caaa7fbfb3007983a54e","observation_id":"b265bfe8-4724-46cf-9f59-ffb10609395e","resolution":{"observed_at":"2026-08-15T20:21:31.483752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.425884Z","title":"Deep q-learning from demonstrations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.425884Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:aca52fb6c73d8464c50ecd1bd1b83491cc7872c790e3435078ae460134e2aa4c","observation_id":"fe546f33-8415-4f92-993b-e61d5dfc2339","resolution":{"observed_at":"2026-08-15T20:21:29.425884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.433662Z","title":"Optimal best-arm identification in linear bandits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.433662Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:c1cacdaa3031dbdec5ede2b632ee0c4606ccf315ee2acee45da6f01d7030f5d1","observation_id":"4d80e72d-04bd-4be8-ab07-65ff2124aa24","resolution":{"observed_at":"2026-08-15T20:21:29.433662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.440235Z","title":"Provably efficient reinforcement learning with linear function approximation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.440235Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:e83b31316688dd6f7ca044bce823f5ff52594c60d5baeb5992c2b7cda0d72141","observation_id":"582dc0a1-c169-4ace-9248-d63eb78cc5ae","resolution":{"observed_at":"2026-08-15T20:21:29.440235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.386081Z","title":"Bellman eluder dimension: New rich classes of rl problems, and sample-efficient algorithms","venue":null,"work_id":"d060dba7-53f7-497e-a250-28dc449bbd61","year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.447002Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:4169181e384f0d377e5be02784f232caaf00f7739c9d7111a3bc6f28ecc4b27b","observation_id":"549a36c1-cb33-402e-a0db-ded1c5cc646a","resolution":{"observed_at":"2026-08-15T20:21:31.398827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.453644Z","title":"Is pessimism provably efficient for offline rl? In International Conference on Machine Learning, pages 5084--5096","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.453644Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:4a0dc03726e22156c98082fbe652c1e9f28b29b63f0dc3bf97308511d6c58647","observation_id":"eb141d2d-c21a-4f56-a2aa-89f723036659","resolution":{"observed_at":"2026-08-15T20:21:29.453644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.460288Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.460288Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:3034e80f29015046fbe9609fb8ff725ba08d273f84a7b21e37fb13f615ea6308","observation_id":"e7ac0e9b-76de-4530-9ae9-4ef74f1c9216","resolution":{"observed_at":"2026-08-15T20:21:29.460288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.315200Z","title":"Asymptotically efficient adaptive allocation rules","venue":null,"work_id":"7ec9cc43-8993-4db3-91d2-fbfc7dce98c9","year":1985},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.467738Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:479a0d026010fa54f2a0ec3265320b057330693a7bd67cfebf00314affc60945","observation_id":"9dd65cf7-1b34-4045-80ca-b603d1c277c5","resolution":{"observed_at":"2026-08-15T20:21:31.323438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.476237Z","title":"Bandit algorithms","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.476237Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:d373e9334bed7a183ed4f17574d325c086b499805d5558f07517132896c7bd4c","observation_id":"48770e6b-2a6e-4cbd-a145-19f174a6274f","resolution":{"observed_at":"2026-08-15T20:21:29.476237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.483421Z","title":"Offline-to-online reinforcement learning via balanced replay and pessimistic q-ensemble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.483421Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:6b0af7e1e7756318232d62f7d06240e915e0603f27067b7ac85b298cba6b7643","observation_id":"92c2d990-9539-41b7-8a02-2a9f06ad463e","resolution":{"observed_at":"2026-08-15T20:21:29.483421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.249037Z","title":"Lee, Yuejie Chi, and Yuxin Chen","venue":null,"work_id":"24562b21-15d3-49cb-bf64-1e1f29ba534e","year":2023},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.490173Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:097b7d16241d9c01b31ee8a034b4459d932bde4ca118fbb504bbef230aeab314","observation_id":"1fd1f3f3-1d2e-4905-9663-0cde19d7c110","resolution":{"observed_at":"2026-08-15T20:21:31.258080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.222290Z","title":"Settling the sample complexity of model-based offline reinforcement learning","venue":null,"work_id":"b074aaef-b09d-4e27-b5c1-9b7927c52b72","year":2024},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.496105Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:e27453d308f59d4799fcd7540c1679380802bc91d17a1e492dcf56eedc857343","observation_id":"44abf8ef-5c8d-4d7b-bf1a-d4459351a26a","resolution":{"observed_at":"2026-08-15T20:21:31.229101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.198962Z","title":"Pessimism for offline linear contextual bandits using l _p confidence sets","venue":null,"work_id":"f19fe13a-5e32-40dc-b2f7-c92e9074cc4d","year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.504425Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:fcb1e6c8b373ba8f63981201bf2e21e0ee6718f19c855e57382b722a6e539460","observation_id":"6b53940f-e37c-4738-a6b0-c4f072530764","resolution":{"observed_at":"2026-08-15T20:21:31.208203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.512902Z","title":"A contextual-bandit approach to personalized news article recommendation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.512902Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:50fd6191a5dfedb036b764645e5c4a3b60e1f70e5c69313779a4f7bdae8928a6","observation_id":"e61f07a1-673f-495b-88fb-876bcfaadb62","resolution":{"observed_at":"2026-08-15T20:21:29.512902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.146136Z","title":"Fast active learning for pure exploration in reinforcement learning","venue":null,"work_id":"d2eaa6af-6e22-476b-adfa-257449982d43","year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.520932Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:b5f8d1a2a28266524d787e0898a42fcce7202714ee9f3a3500d720ffc9ebc52f","observation_id":"987369e1-50d9-462b-ab7c-2165fc6a5f6b","resolution":{"observed_at":"2026-08-15T20:21:31.159599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.530093Z","title":"Efficient memory-based learning for robot control","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.530093Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:475700160680cc4d4de28b8721975d2a3b431d86643afb3d17fc0a3bfe079616","observation_id":"f557d306-35f1-454a-b0b5-d501c09e3a6d","resolution":{"observed_at":"2026-08-15T20:21:29.530093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.093923Z","title":"Collaborative-filtering","venue":null,"work_id":"fd8e16d3-f8e0-41cc-b5ff-a13708b24178","year":2019},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.539479Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:6dfbbfe9fbc8c83b86430b8429e683395cb778d56a18e35734283b93df5a1304","observation_id":"548bff10-8852-4329-83df-625b62a4ff98","resolution":{"observed_at":"2026-08-15T20:21:31.105132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.547938Z","title":"Finite-time bounds for fitted value iteration","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.547938Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:12f2bcdb4c9a82fe70cc5d4f7b385986af7c84de062be82ca111899082423878","observation_id":"c9ac7849-878d-47fc-a732-d1156fe9ac2f","resolution":{"observed_at":"2026-08-15T20:21:29.547938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.027939Z","title":"Overcoming exploration in reinforcement learning with demonstrations","venue":null,"work_id":"1efb4259-4ece-45fc-973a-3c9ac5333b4c","year":2018},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.556309Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:a34508ca08ed17a7a572ae7037f6998b7c03b032cccdaa92abe2c025f2a1d8be","observation_id":"70166982-94ee-4140-930b-0fbe349720a1","resolution":{"observed_at":"2026-08-15T20:21:31.036110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-15T20:21:29.565639Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.565639Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:62b00c2a1abe4d42de0ce9035d725b592f87aae3a6a69458944fa70fe3e4126e","observation_id":"f668b8b1-7887-44cc-91b5-c1c598401423","resolution":{"observed_at":"2026-08-15T20:21:29.565639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13807","last_updated":"2022-03-13T14:15:14Z","snapshot_observed_at":"2026-08-16T17:50:25.439484Z","submitted_at":"2021-11-27T03:57:13Z","title":"Offline Neural Contextual Bandits: Pessimism, Optimization and Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13807","snapshot_observed_at":"2026-08-15T20:21:29.572118Z","title":"Offline neural contextual bandits: Pessimism, optimization and generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.572118Z"},"links":{"cited_paper":"/paper/2111.13807","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:0bf589ba59a94d4ee101e283e58b40b0c9aac1a42e8fe1abd4a2fc4903d6a9d6","observation_id":"a68c2aa5-0991-45f9-96ce-9013e9e23a41","resolution":{"observed_at":"2026-08-15T20:21:29.572118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:31.000143Z","title":"Cutting to the chase with warm-start contextual bandits","venue":null,"work_id":"0b0adb78-cecd-4b01-8c2f-0f7231e1bcdd","year":2023},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.579950Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:7b951b0124b4a22f0f6530fdea6001077ad59f81bb0266b5cf8b1a60847f1378","observation_id":"42d21d93-8346-44dc-a5be-0bd20480f589","resolution":{"observed_at":"2026-08-15T20:21:31.008409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.10087","last_updated":"2018-06-26T13:31:37Z","snapshot_observed_at":"2026-08-15T17:49:11.636243Z","submitted_at":"2017-09-28T17:51:13Z","title":"Learning Complex Dexterous Manipulation with Deep Reinforcement Learning and Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.10087","snapshot_observed_at":"2026-08-15T20:21:29.587974Z","title":"Learning complex dexterous manipulation with deep reinforcement learning and demonstrations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.587974Z"},"links":{"cited_paper":"/paper/1709.10087","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:509a3b8456ac88728efaf5148892a7338f778862bbd323cbcd09af5ee945b96c","observation_id":"a23cd302-2197-4e6e-a6d0-ab54448f3761","resolution":{"observed_at":"2026-08-15T20:21:29.587974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.967218Z","title":"Bridging offline reinforcement learning and imitation learning: A tale of pessimism","venue":null,"work_id":"feb1d782-5c41-4691-982d-f453b9badf12","year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.594940Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:70c8df88fc30341ee9693e69cc9dc21381b0ff823970f654dc75555e587869f7","observation_id":"c2f7c428-45d9-4047-8262-7d8052ce2572","resolution":{"observed_at":"2026-08-15T20:21:30.981176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1203.1007","last_updated":"2012-07-03T13:48:40Z","snapshot_observed_at":"2026-08-15T04:17:15.488968Z","submitted_at":"2012-03-05T18:58:49Z","title":"Agnostic System Identification for Model-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1203.1007","snapshot_observed_at":"2026-08-15T20:21:29.600345Z","title":"Agnostic system identification for model-based reinforcement learning","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.600345Z"},"links":{"cited_paper":"/paper/1203.1007","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:55fdffc1f3c4353d60792961f20b8d025e11867b4225ea29d84039d4dc212a85","observation_id":"6c010a11-7c86-4337-8617-ef321ed93183","resolution":{"observed_at":"2026-08-15T20:21:29.600345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08405","last_updated":"2024-10-28T01:20:42Z","snapshot_observed_at":"2026-08-20T05:45:38.750603Z","submitted_at":"2020-02-19T19:36:43Z","title":"Bandits with Mean Bounds","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08405","snapshot_observed_at":"2026-08-15T20:21:29.612927Z","title":"Warm starting bandits with side information from confounded data","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.612927Z"},"links":{"cited_paper":"/paper/2002.08405","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:44c2a635408b985231dab4eae449bd99be55203f8e982755c086729d3cb42850","observation_id":"ef0b3f80-f1e1-4e99-989f-385b3fdab78b","resolution":{"observed_at":"2026-08-15T20:21:29.612927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.939391Z","title":"Multi-armed bandit problems with history","venue":null,"work_id":"5704546e-a1bd-40ca-9836-3baca4b37c96","year":2012},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.622678Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:99efa3447a12ad711074393a8b364d68211f6c7d41f1c46fc45cf7835acc8c62","observation_id":"ec621217-6fcc-48d3-98c6-c099f076e4ee","resolution":{"observed_at":"2026-08-15T20:21:30.946397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.898643Z","title":"User cold-start problem in multi-armed bandits: When the first recommendations guide the user’s experience","venue":null,"work_id":"41e81a12-65f9-4284-b894-3266f120e500","year":2023},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.632051Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:1438f2aef81a48f0023cdf6a61e0a932b3c8ea5e7ae7fefe68d29ba700849243","observation_id":"796f590c-eb96-45de-829c-327756193768","resolution":{"observed_at":"2026-08-15T20:21:30.909059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.857620Z","title":"Best-arm identification in linear bandits","venue":null,"work_id":"84e911dc-7f9d-4f77-ac85-01795cee8ac3","year":2014},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.648294Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:b9e12dcd91a5cadedf89718bb436cf22db7c176adfaf32e198eb3635a86a9fa0","observation_id":"072ccc22-bb4b-4321-8cbd-af8035632d12","resolution":{"observed_at":"2026-08-15T20:21:30.869269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06718","last_updated":"2023-03-11T11:47:54Z","snapshot_observed_at":"2026-08-16T16:24:37.265288Z","submitted_at":"2022-10-13T04:19:05Z","title":"Hybrid RL: Using Both Offline and Online Data Can Make RL Efficient","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06718","snapshot_observed_at":"2026-08-15T20:21:29.656847Z","title":"Hybrid rl: Using both offline and online data can make rl efficient","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.656847Z"},"links":{"cited_paper":"/paper/2210.06718","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:1a3c0794180f198298c630fc15297f04f469a8705a6d30760fbe18eefa601cb9","observation_id":"905dd96b-4a67-4054-979a-a5edb08b2da2","resolution":{"observed_at":"2026-08-15T20:21:29.656847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.833393Z","title":null,"venue":null,"work_id":"b492838e-5d83-4cf0-a407-f9ce0978bdfe","year":1998},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.669284Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:79d643e4ddf60d9330275daa0237e17039536303cb66af7474bfffe1d316d407","observation_id":"d557b812-f358-4906-9f25-cbfe7e9a1778","resolution":{"observed_at":"2026-08-15T20:21:30.840977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.677081Z","title":"Algorithms for reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.677081Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:b33e41c1c64f7b8e592a815dc305ae1fc3370eba37f33ad8298889eab1713caa","observation_id":"ef0ef3db-819e-4f9f-995d-2cdc6b32b605","resolution":{"observed_at":"2026-08-15T20:21:29.677081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09701","last_updated":"2024-03-18T02:18:16Z","snapshot_observed_at":"2026-08-16T20:32:27.956756Z","submitted_at":"2024-03-07T19:39:47Z","title":"A Natural Extension To Online Algorithms For Hybrid RL With Limited Coverage","version":2},"cited_work":{"arxiv_id":"2403.09701","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09701","snapshot_observed_at":"2026-08-15T20:21:30.147115Z","title":"A Natural Extension To Online Algorithms For Hybrid RL With Limited Coverage","venue":"cs.LG","work_id":"c03b93fc-98ea-42d1-a389-d583f01803d3","year":2024},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.685128Z"},"links":{"cited_paper":"/paper/2403.09701","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:6c306ac9b972729c9e8c64d13447df05f496262c139ab4a0d6dca1e1be173dc2","observation_id":"4fabacf2-bb9e-4fca-b173-82e627b3c8fc","resolution":{"observed_at":"2026-08-15T20:21:30.160097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04526","last_updated":"2024-08-08T15:26:18Z","snapshot_observed_at":"2026-08-16T13:27:39.748228Z","submitted_at":"2024-08-08T15:26:18Z","title":"Hybrid Reinforcement Learning Breaks Sample Size Barriers in Linear MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04526","snapshot_observed_at":"2026-08-15T20:21:29.691317Z","title":"Hybrid reinforcement learning breaks sample size barriers in linear mdps","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.691317Z"},"links":{"cited_paper":"/paper/2408.04526","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:6e3b3b33d394e9b952716e5ee7214c8dbc2e57022f6385c435b7b726737c1b01","observation_id":"55fb2b55-bc45-4ca8-842e-fe744e94b712","resolution":{"observed_at":"2026-08-15T20:21:29.691317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.790312Z","title":"Predictive off-policy policy evaluation for nonstationary decision problems, with applications to digital marketing","venue":null,"work_id":"8400cb38-1393-4f48-90cd-459cc8d87a8d","year":2017},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.697435Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:9af4e9c4b2ae493c6190a793c8e58c18e973143fd6a94fa84b5c833802616d7f","observation_id":"df602222-d459-41ae-9e10-d48e203e50b1","resolution":{"observed_at":"2026-08-15T20:21:30.799656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.705219Z","title":"On the likelihood that one unknown probability exceeds another in view of the evidence of two samples","venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.705219Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:e3792cd74b278cb47d8dbe42ae8a024108a5c65362a9bad0cb416b54745da738","observation_id":"b0332b30-f19e-40ce-8a94-878cb945dace","resolution":{"observed_at":"2026-08-15T20:21:29.705219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-08-13T22:24:37.672685Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-15T20:21:29.713695Z","title":"Gymnasium: A standard interface for reinforcement learning environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.713695Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:56a2b691b0a40c2dbc99299640b005d3a9b690d7b0968e3beadd2baef2cbbef5","observation_id":"f3f4b2b8-416b-4af7-97f8-942f265df193","resolution":{"observed_at":"2026-08-15T20:21:29.713695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.746182Z","title":"Pessimistic model-based offline reinforcement learning under partial coverage","venue":null,"work_id":"a316366e-37d8-4b6f-8d61-4dce0bb6ad85","year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.722442Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:bfa9c634b4e92afb1156730633bdc72f47302008f5568774e6c3be843be46345","observation_id":"a9c0dbe8-6e5e-4322-9442-971d1fa2aae3","resolution":{"observed_at":"2026-08-15T20:21:30.753059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04652","last_updated":"2022-01-06T04:33:56Z","snapshot_observed_at":"2026-08-20T14:19:49.412387Z","submitted_at":"2021-10-09T22:04:34Z","title":"Representation Learning for Online and Offline RL in Low-rank MDPs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04652","snapshot_observed_at":"2026-08-15T20:21:29.732840Z","title":"Representation learning for online and offline rl in low-rank mdps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.732840Z"},"links":{"cited_paper":"/paper/2110.04652","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:69afcfcea297c69dcea57bf4d4442ca9df1f879ad3197fc65d9799ef65293d2f","observation_id":"3cac87ee-b04c-4e77-b05d-d5f45757dcd9","resolution":{"observed_at":"2026-08-15T20:21:29.732840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.744641Z","title":"Instance-dependent near-optimal policy identification in linear mdps via online experiment design","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.744641Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:cc74b3d47345db1bf21f6873857814e87339e95e659f1087f8ca6ce574657a58","observation_id":"87db7217-299f-4cca-b768-227f46ae0dfb","resolution":{"observed_at":"2026-08-15T20:21:29.744641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.704204Z","title":"Leveraging offline data in online reinforcement learning","venue":null,"work_id":"c7d27478-1c11-4583-8f19-0f2cb3b71fde","year":2023},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.750323Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:d694f836294b1aa30c1240eeff24f3e7490a204669239619a683c1fe557e57eb","observation_id":"f508c3f2-438e-48e1-b5da-9d5d4cee3c12","resolution":{"observed_at":"2026-08-15T20:21:30.710969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.680113Z","title":"Experimental design for regret minimization in linear bandits","venue":null,"work_id":"872f59d4-05c3-4622-9440-485257430503","year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.758386Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:5d01cbfa9f7a2870fee2e598a8d945ef0b182641c8fd6a0004e032b4bc7bbec9","observation_id":"685e482b-1df0-4cd1-9d5c-2a4c6f90efbd","resolution":{"observed_at":"2026-08-15T20:21:30.689024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07923","last_updated":"2023-10-25T23:57:55Z","snapshot_observed_at":"2026-08-16T17:49:39.973786Z","submitted_at":"2023-06-13T17:29:50Z","title":"Oracle-Efficient Pessimism: Offline Policy Optimization in Contextual Bandits","version":2},"cited_work":{"arxiv_id":"2306.07923","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.07923","snapshot_observed_at":"2026-08-15T20:21:30.023408Z","title":"Oracle-Efficient Pessimism: Offline Policy Optimization in Contextual Bandits","venue":"cs.LG","work_id":"d7d43c87-98db-4403-bcc8-8bf93e130ee4","year":2023},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.768398Z"},"links":{"cited_paper":"/paper/2306.07923","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:80a017ece6d349fc9d834d87aa9c2288965b97a8444608caa34c398967964931","observation_id":"09163372-f577-437b-8cb6-8605aac2909b","resolution":{"observed_at":"2026-08-15T20:21:30.031698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.657951Z","title":"Bellman-consistent pessimism for offline reinforcement learning","venue":null,"work_id":"59ed5920-71f4-4e5b-8428-3c46c07e878c","year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.778054Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:49e7abd3eb6a81b1c1662e1649ece3a262530d2c227d5522324cbb9de940817a","observation_id":"0716a315-be0d-4d68-8c23-e9ece9cd99ac","resolution":{"observed_at":"2026-08-15T20:21:30.665695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.635614Z","title":"Policy finetuning: Bridging sample-efficient offline and online reinforcement learning","venue":null,"work_id":"06da09aa-44d6-4893-96f6-3cc87014dfe1","year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.787656Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:a7f89db5dd14a56791a9ba8e4260db92277dc0cd990844c9d35998db4c286cfd","observation_id":"d779f11e-5fb4-4a27-b7e3-099c6753d832","resolution":{"observed_at":"2026-08-15T20:21:30.642102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15512","last_updated":"2023-03-01T13:37:28Z","snapshot_observed_at":"2026-08-16T16:56:28.166638Z","submitted_at":"2022-05-31T02:50:17Z","title":"Nearly Minimax Optimal Offline Reinforcement Learning with Linear Function Approximation: Single-Agent MDP and Markov Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15512","snapshot_observed_at":"2026-08-15T20:21:29.794976Z","title":"Nearly minimax optimal offline reinforcement learning with linear function approximation: Single-agent mdp and markov game","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.794976Z"},"links":{"cited_paper":"/paper/2205.15512","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:f16012356227169e994b5a6c864e67839e460ec2507b08d37c7d0e5fe4d349b8","observation_id":"ec161056-9f73-4450-8caf-ccb1b88a4a80","resolution":{"observed_at":"2026-08-15T20:21:29.794976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.801662Z","title":"Minimax optimal fixed-budget best arm identification in linear bandits","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.801662Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:9d4810dffcfde897761d7940dd33c691bb87cd54769badf57cccbbc9077ca04b","observation_id":"e7181073-99bf-43f7-83f0-2b3174dbdbba","resolution":{"observed_at":"2026-08-15T20:21:29.801662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11423","last_updated":"2023-11-19T21:02:17Z","snapshot_observed_at":"2026-08-16T14:42:01.017905Z","submitted_at":"2023-11-19T21:02:17Z","title":"Offline Reinforcement Learning for Wireless Network Optimization with Mixture Datasets","version":1},"cited_work":{"arxiv_id":"2311.11423","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11423","snapshot_observed_at":"2026-08-15T20:21:29.960495Z","title":"Offline Reinforcement Learning for Wireless Network Optimization with Mixture Datasets","venue":"cs.IT","work_id":"9d1c44c3-f7a1-4856-a4d6-1053d21a9ac4","year":2023},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.810991Z"},"links":{"cited_paper":"/paper/2311.11423","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:e4d1d8fa8b3917a1bd4c8a2d73b1ff876be9a6cf6d18e7a806c6a50d22169376","observation_id":"5d7e2902-3ce0-4eec-bcd5-fe73934058d7","resolution":{"observed_at":"2026-08-15T20:21:29.968928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.598311Z","title":"Provable benefits of actor-critic methods for offline reinforcement learning","venue":null,"work_id":"32cd747d-0219-457e-a9a8-f5db4c0fd42e","year":2021},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.819313Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:c0a1868ffa0d93cad767f04f700b47a5d21bf1acc01ce5bee842d4d7f79b3450","observation_id":"ff14bda5-a614-463d-96cc-aba9a321377b","resolution":{"observed_at":"2026-08-15T20:21:30.605103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.00301","last_updated":"2019-06-21T19:25:56Z","snapshot_observed_at":"2026-08-17T03:05:34.104817Z","submitted_at":"2019-01-02T09:15:02Z","title":"Warm-starting Contextual Bandits: Robustly Combining Supervised and Bandit Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.00301","snapshot_observed_at":"2026-08-15T20:21:29.829348Z","title":"Warm-starting contextual bandits: Robustly combining supervised and bandit feedback","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.829348Z"},"links":{"cited_paper":"/paper/1901.00301","citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:b5426eefed6f47b03f017cc98342a27a228cb5ccb0b5e2fa12a3b3eb9d59d1a9","observation_id":"4af4ccfb-fb8b-4844-9c47-dd6400cd56b6","resolution":{"observed_at":"2026-08-15T20:21:29.829348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.840130Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.840130Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:62cf4a6f1fc555487a2a96a7bd4bd64089c854ec2f9a3a813fc09cfe0ccfb877","observation_id":"c67f8696-c5ea-46ea-ab54-995e8465a604","resolution":{"observed_at":"2026-08-15T20:21:29.840130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:29.850447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.850447Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:6997a193bf5e2dbbe7e3bc511d6f12a00f80e2a185fc30d80816633b7e3d345a","observation_id":"cdcc5227-6b28-4a7b-9012-800c7f84a40a","resolution":{"observed_at":"2026-08-15T20:21:29.850447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:21:30.516442Z","title":"page @startpage numbered @text Submitted to @long ( @short)","venue":null,"work_id":"ac3f5037-31d9-4525-98bd-621b710101bb","year":2019},"citing_paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T20:21:29.861150Z"},"links":{"citing_paper":"/paper/2505.13768"},"observation_digest":"sha256:0ca5cacb47135a4790f16867457fec3c0d0709c892be0dda52435a161afded7b","observation_id":"9079adcb-e6d0-4853-b3f4-ae45c8c1c524","resolution":{"observed_at":"2026-08-15T20:21:30.535409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13768","last_updated":"2025-06-27T21:05:50Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T14:20:47.383916Z","submitted_at":"2025-05-19T22:58:54Z","title":"Augmenting Online RL with Offline Data is All You Need: A Unified Hybrid RL Algorithm Design and Analysis"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":3,"verified_fuzzy":28},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 1 inbound Pith citation observation for arXiv:2505.13768."}