{"as_of":"2026-08-11T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f7ff9438e49e849e8670c8031af160ba9519f5d5a11779b29f981a74b0276cc","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:09:21.939768Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T18:10:52.644951Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-09T06:45:40.553981Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"cited_work":{"arxiv_id":"2506.06521","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06521","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2506.06521 [cs.LG] https://arxiv.org/abs/2506.06521","venue":null,"work_id":"8213fd20-504f-455c-8ffc-d5fa66d84e5e","year":null},"citing_paper":{"arxiv_id":"2605.04979","last_updated":"2026-05-06T14:32:18Z","snapshot_observed_at":"2026-07-06T23:17:38.226365Z","submitted_at":"2026-05-06T14:32:18Z","title":"On-line Learning in Tree MDPs by Treating Policies as Bandit Arms","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T18:10:52.644951Z"},"links":{"cited_paper":"/paper/2506.06521","citing_paper":"/paper/2605.04979"},"observation_digest":"sha256:46762b1b8b510e270347f3e2b0963ee21b2c79d5287f2da207a8762a09109f69","observation_id":"229aedfe-0a81-41e4-9f90-efbe3fc4d041","resolution":{"observed_at":"2026-05-09T06:45:40.556056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06521/citation-record","integrity":"/paper/2506.06521/integrity","json":"/paper/2506.06521/citation-record.json","paper":"/paper/2506.06521"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:23.052715Z","title":"Navigating to the best policy in markov decision processes","venue":null,"work_id":"d17db4ee-02ee-472c-972f-2ac7d67111bb","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.645313Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:f9b51e7e60b2fbed05e6e0fa875a37e43b33ff7c4ccbe21a6b557eab85a55f77","observation_id":"752a21c9-eded-434d-be7b-0f168f5d613f","resolution":{"observed_at":"2026-08-07T06:09:23.062037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.650637Z","title":"Logarithmic online regret bounds for undiscounted reinforcement learning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.650637Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:e44297b1b971f0ccd6270c78e8a08dcd2e0fcc0dea25914b9a39a528c9a3a2ad","observation_id":"3e9af9e9-27e2-47d8-8e8b-e7c0ff6e7545","resolution":{"observed_at":"2026-08-07T06:09:21.650637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:23.011162Z","title":"Finite-time analysis of the multiarmed bandit problem","venue":null,"work_id":"fddfe548-a5a6-489f-9da8-4a047863381f","year":2002},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.655458Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:7a4d6e77d64cf759cf40d17f2b04e1c9786222f77730815b2356ac1ebd57d93e","observation_id":"2f7ec633-71fd-414e-bb52-31eb330fa6ce","resolution":{"observed_at":"2026-08-07T06:09:23.022547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.660747Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.660747Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:7a921be98e27b41a401646573d43b19080263a7d924583c9f2c936a1d0825bd3","observation_id":"1560998c-4618-4634-a281-39ba3a04691c","resolution":{"observed_at":"2026-08-07T06:09:21.660747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.665444Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.665444Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:b52c6967aee9b7d11028faa0236437279dcfe7b7ed120e8d70dd0b7e4474677c","observation_id":"e5655449-346d-46ee-9f2c-2fe69a778fac","resolution":{"observed_at":"2026-08-07T06:09:21.665444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.2661","last_updated":"2012-05-09T14:47:06Z","snapshot_observed_at":"2026-07-06T02:47:58.266745Z","submitted_at":"2012-05-09T14:47:06Z","title":"REGAL: A Regularization based Algorithm for Reinforcement Learning in Weakly Communicating MDPs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.2661","snapshot_observed_at":"2026-08-07T06:09:21.670031Z","title":"Regal: A regularization based algorithm for reinforcement learning in weakly communicating mdps","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.670031Z"},"links":{"cited_paper":"/paper/1205.2661","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:e520838d2c084dc69516df96dc88a6d81eee0841cd7e06de9f9818651d216b5f","observation_id":"e54fec24-9f68-4cf5-aa49-5f8fe58a873c","resolution":{"observed_at":"2026-08-07T06:09:21.670031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.675666Z","title":"Regret analysis of stochastic and nonstochastic multi-armed bandit problems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.675666Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:8fe5122b97d9768752d47b47844dd95779220c988f00d6d69a8f21a937191bae","observation_id":"c29630a4-0f78-40e9-887c-b334b8b794a4","resolution":{"observed_at":"2026-08-07T06:09:21.675666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.936659Z","title":"Top-k off-policy correction for a reinforce recommender system","venue":null,"work_id":"eb820811-f4f4-4fc6-b0a6-36f2b7eea289","year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.680902Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:0fe99a7072b77dd84547a47d3ccf56cfe2147438a6e6af5e20f9ad1641a26580","observation_id":"8f3663fe-4d78-4094-b5ae-d7cf90cf1a0d","resolution":{"observed_at":"2026-08-07T06:09:22.961449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13450","last_updated":"2023-02-06T19:28:32Z","snapshot_observed_at":"2026-08-09T15:30:20.587391Z","submitted_at":"2022-05-26T15:55:44Z","title":"Variance-Aware Sparse Linear Bandits","version":3},"cited_work":{"arxiv_id":"2205.13450","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.13450","snapshot_observed_at":"2026-08-07T06:09:22.077430Z","title":"Variance-Aware Sparse Linear Bandits","venue":"cs.LG","work_id":"0587b27e-49f6-4df3-8e09-f04acc3cfd65","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.685486Z"},"links":{"cited_paper":"/paper/2205.13450","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:37435f654a92ab73bdd4e6b415285c8e8e7e50821b3fd3c56cd6301e1556dca0","observation_id":"d1ac95b1-9f22-4f96-ae91-10a8d6604ec1","resolution":{"observed_at":"2026-08-07T06:09:22.085200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.894812Z","title":"Policy certificates: Towards accountable reinforcement learning","venue":null,"work_id":"fbaa5e24-4175-44f7-8936-6f773fa87768","year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.690575Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:a701322e66ff9d30c0bfc214a7331fdfbc46f147d1167f45d8da4471944c6122","observation_id":"cec2c58e-e241-40a0-9c94-fdd2d08dfd2b","resolution":{"observed_at":"2026-08-07T06:09:22.912679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.695323Z","title":"Beyond value-function gaps: Improved instance-dependent regret bounds for episodic reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.695323Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:d4a725d319d33f068ebc7fa6b375f64a668da0626b90afdcb22f5c2922af9591","observation_id":"6fa8dfe2-4779-4705-9abb-c97da5ade988","resolution":{"observed_at":"2026-08-07T06:09:21.695323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.853180Z","title":"Gap-dependent bounds for two-player markov games","venue":null,"work_id":"9635e669-9a6f-403d-9dce-8b52de9e7204","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.700715Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:7284ce7e25358b3a3fe09d41433a8bd3915803a5dfdbc703e6acec081051f2e8","observation_id":"60b87a59-dc4d-49ed-a24e-ebb846250806","resolution":{"observed_at":"2026-08-07T06:09:22.865549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.833346Z","title":"Cascaded gaps: Towards logarithmic regret for risk-sensitive reinforcement learning","venue":null,"work_id":"9f161fa4-2810-4a71-aced-5dd88b1e93e0","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.705363Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:82fc9e3fe280ae8dafe56df2af34360b57c9b2af54b8976335eb2b667234bda3","observation_id":"a168d2be-fb72-4c2d-a587-6dbfc37b7b0a","resolution":{"observed_at":"2026-08-07T06:09:22.842175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.812844Z","title":"Efficient bias-span-constrained exploration-exploitation in reinforcement learning","venue":null,"work_id":"1c9bdd38-5d50-4356-8847-ed9e1c1c27ba","year":2018},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.709935Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:1bb6dc2621f881fbf538c1a68396f67df73cfc641c4f36428de6da1cdb1715cf","observation_id":"d22e8a7b-3d5e-480c-8a43-fe6b483cb5ad","resolution":{"observed_at":"2026-08-07T06:09:22.820123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.793525Z","title":"Logarithmic regret for reinforcement learning with linear function approximation","venue":null,"work_id":"3a09b920-a378-47b0-b454-33152a0b0535","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.714557Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:54d25583eb0dfb5695597c3fad54000079999a8510b434e9c8ec97c8ea048d44","observation_id":"ec4381ac-2eb4-48cf-9940-8968b0f5725d","resolution":{"observed_at":"2026-08-07T06:09:22.800170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.773774Z","title":"Tackling heavy-tailed rewards in reinforcement learning with function approximation: Minimax optimal and instance-dependent regret bounds","venue":null,"work_id":"894ac17b-e5f2-4972-be59-8aa6d24892a2","year":2023},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.719607Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:d6cf1156cf168e91ddce6c53a58e96d969fa05da71db9efd75624fc1d7b1d7bd","observation_id":"0076f097-b362-4663-b39d-45d547528fa1","resolution":{"observed_at":"2026-08-07T06:09:22.780075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.723948Z","title":"Is q-learning provably efficient? Advances in neural information processing systems, 31, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.723948Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:739e5ca4653ec5ae6764a10d820ba091e9e715643035232ad87a2f3321bcb9eb","observation_id":"4c146e2b-e269-42fb-9c88-5f62ed713de8","resolution":{"observed_at":"2026-08-07T06:09:21.723948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.742998Z","title":"Reward-free exploration for reinforcement learning","venue":null,"work_id":"f2957f95-3c81-4bf1-93e8-b36cb167fb19","year":2020},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.728273Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:93d24215484c74ae652a31f7cfc674899425ceba09f507b7f065cc7ebadba553","observation_id":"aaf290a2-8bd0-4d6a-927c-49934c46ac58","resolution":{"observed_at":"2026-08-07T06:09:22.751095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.721476Z","title":"Planning in markov decision processes with gap-dependent sample complexity","venue":null,"work_id":"6438e1cc-b3c4-4040-9244-9825de97b455","year":2020},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.732692Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:1143653bb945720383f3f50093e620ad0288a46c4fe7224afdbabf6ae68370bf","observation_id":"4001edbd-21f0-4c19-b55c-fc39d77c45e5","resolution":{"observed_at":"2026-08-07T06:09:22.729062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.701233Z","title":"Improved regret analysis for variance-adaptive linear bandits and horizon-free linear mixture mdps","venue":null,"work_id":"4d3989cc-8075-48c6-aeed-1a02c43258db","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.737357Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:2233d12300778dd462fa517ed632ecec1a7cd37c7c5317eb511f49011fe1b2c5","observation_id":"e9893598-862c-4221-92c3-14e79de722bd","resolution":{"observed_at":"2026-08-07T06:09:22.708304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.742030Z","title":"Asymptotically efficient adaptive allocation rules","venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.742030Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:b95bbd51da869b2bb362129020dae1fe7a57fd24a0de368bcc34dbee8a0ca716","observation_id":"e3b9b6b2-9766-4c14-9ef0-847e3dce72d3","resolution":{"observed_at":"2026-08-07T06:09:21.742030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.668048Z","title":"Breaking the sample complexity barrier to regret-optimal model-free reinforcement learning","venue":null,"work_id":"c5443467-33bf-4ce0-98bc-9057c3467898","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.746775Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:25a41459d20ea94cf0270af130237813759f6e6830b219691944fdbba1523af9","observation_id":"e475c0b6-34e8-4d90-b0ca-53a9292c24d2","resolution":{"observed_at":"2026-08-07T06:09:22.675579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-07T06:09:21.751752Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.751752Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:7e6bd1eb6a5bc3cd9fa18d75c0aea19222251704e755b508a76d1ed8bb20cdb1","observation_id":"0374572d-fe69-4408-9c01-0759e382bb4f","resolution":{"observed_at":"2026-08-07T06:09:21.751752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.647298Z","title":"Deep reinforcement learning for dynamic treatment regimes on medical registry data","venue":null,"work_id":"416ededc-e59f-400f-8641-8a78af34c7ba","year":2017},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.756482Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:39970f9032c6ea3e00008b087d20cde1db54a74ddcf4b290c7426b29f053660e","observation_id":"d0a8208e-7d51-4449-b65d-cd43cbc729b9","resolution":{"observed_at":"2026-08-07T06:09:22.655567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13405","last_updated":"2021-05-10T16:40:20Z","snapshot_observed_at":"2026-08-10T02:19:17.795316Z","submitted_at":"2020-09-28T15:22:24Z","title":"Adaptive Sampling for Best Policy Identification in Markov Decision Processes","version":4},"cited_work":{"arxiv_id":"2009.13405","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.13405","snapshot_observed_at":"2026-08-07T06:09:22.032726Z","title":"Adaptive Sampling for Best Policy Identification in Markov Decision Processes","venue":"stat.ML","work_id":"a865967c-9075-4f4d-9c71-2cd3eda1d93c","year":2020},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.761176Z"},"links":{"cited_paper":"/paper/2009.13405","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:4cf9d2d163569ab502823a6ab10b613eb795ef57763c663e77a754371a88160b","observation_id":"dfa9340b-fa18-408b-bcbb-1d0b634b2f37","resolution":{"observed_at":"2026-08-07T06:09:22.039979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"0907.3740","last_updated":"2009-07-21T20:21:38Z","snapshot_observed_at":"2026-08-10T10:13:00.290851Z","submitted_at":"2009-07-21T20:21:38Z","title":"Empirical Bernstein Bounds and Sample Variance Penalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"0907.3740","snapshot_observed_at":"2026-08-07T06:09:21.766080Z","title":"Empirical bernstein bounds and sample variance penalization","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.766080Z"},"links":{"cited_paper":"/paper/0907.3740","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:ff4e3c7448c45c358b571375527cd0ee76e0a0fc6fe5bf726e7eac2f6e8e22e8","observation_id":"82315765-0338-43ad-bf3a-22ed3b6f355b","resolution":{"observed_at":"2026-08-07T06:09:21.766080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.625903Z","title":"Ucb momentum q-learning: Correcting the bias without forgetting","venue":null,"work_id":"b422b148-80b1-4aa4-bdf9-597e5f8589b9","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.771025Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:47323e42944d6a4bcf0bfbbad7038b97365f97808dae3910aacf1891bbbea81f","observation_id":"da871a9a-82bc-4c25-9641-0600ed1a9997","resolution":{"observed_at":"2026-08-07T06:09:22.634394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.603978Z","title":"Reinforcement learning for optimized trade execution","venue":null,"work_id":"48f144a9-e325-4532-90d6-6c033db9f847","year":2006},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.775540Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:6cf88469602f02577e1bceea5f46d7b052fcc6fb2bad600efbe19d04262b69d3","observation_id":"7e4070e2-adca-46e5-9b69-c550d4538112","resolution":{"observed_at":"2026-08-07T06:09:22.612325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.585394Z","title":"On instance-dependent bounds for offline reinforcement learning with linear function approximation","venue":null,"work_id":"46e56b0a-81b6-47d0-8087-0003fe146971","year":2023},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.779948Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:72e4d9dd85f379c9b9fa4a40ae24cad39c103c947b554095b355a10bdd356cc7","observation_id":"840d6741-43ff-467c-9513-0fb223349c7e","resolution":{"observed_at":"2026-08-07T06:09:22.592062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.565051Z","title":"Exploration in structured reinforcement learning","venue":null,"work_id":"45706e41-2128-45a4-88e3-557bb9cfd9fe","year":2018},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.784415Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:077a910ad0906efef090e056c31ee207afd642ceb4597bb25d28704571cc061e","observation_id":"83035fc7-3068-41b5-9a09-6380cec19577","resolution":{"observed_at":"2026-08-07T06:09:22.572522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.544464Z","title":"Why is posterior sampling better than optimism for reinforcement learning? In International conference on machine learning, pages 2701--2710","venue":null,"work_id":"0b75d477-0947-46bd-acdd-4c8bc79b4a7c","year":2017},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.788946Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:c6066dbea9bdce6795ecd834d11e9132b9189dd9a8536d86cd1393579641b00a","observation_id":"143457cc-037a-4666-9f5a-426af5f8d651","resolution":{"observed_at":"2026-08-07T06:09:22.552330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.524823Z","title":"Reinforcement learning in linear mdps: Constant regret and representation selection","venue":null,"work_id":"d36ab6a8-8140-497a-b17e-a99d01517ca2","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.793430Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:c36922073b2d8841436ffd198825dbb4f470741f3cb20a059e579438108d543a","observation_id":"dc82e5fe-f4e1-49a8-9b08-93ef8f346b0c","resolution":{"observed_at":"2026-08-07T06:09:22.530992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.797839Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.797839Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:8b9707a5a5ae85bd7e1836aad184f3929066e2a557511b1f2c2e1ec818bd52ec","observation_id":"fdcbba15-75cf-4a2c-8f4e-d664249465b1","resolution":{"observed_at":"2026-08-07T06:09:21.797839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.802739Z","title":"Non-asymptotic gap-dependent regret bounds for tabular mdps","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.802739Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:46d53cb0d3532067558cee4ec34660c5b5323c38695f143e725ddd6334b24377","observation_id":"1c0afb3a-986d-4ccd-8bb4-e9c44f172cfb","resolution":{"observed_at":"2026-08-07T06:09:21.802739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.806964Z","title":"Reinforcement learning: An introduction, volume 1","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.806964Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:7d8534f0ac516dcfc38b7021ea58579677dfdbe1962815a270aabd5d92a5115f","observation_id":"53f03b79-cce4-4b1a-a750-b79a831414fd","resolution":{"observed_at":"2026-08-07T06:09:21.806964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.473542Z","title":"Variance-aware regret bounds for undiscounted reinforcement learning in mdps","venue":null,"work_id":"b22e19be-92f8-4cb6-b0a5-5a6884d9406a","year":2018},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.811736Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:47e0df25731685ce29ae29c3d03f4920072cf9ccf3cf234db830a0bc301a6aa7","observation_id":"ce9bbdc6-dc6b-45b5-b181-dd2192b8093f","resolution":{"observed_at":"2026-08-07T06:09:22.481576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.454092Z","title":"Optimistic linear programming gives logarithmic regret for irreducible mdps","venue":null,"work_id":"512b6902-3c55-4fe1-a373-67f6ee1c084a","year":2007},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.816074Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:e8ecb4e151cf2bfdd9d5262fd048554f6859ce6d1c9bcd7b264ea31861ea1842","observation_id":"a7757793-65e0-4df2-a5bc-6aca707c4cd1","resolution":{"observed_at":"2026-08-07T06:09:22.460484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.435604Z","title":"Near instance-optimal pac reinforcement learning for deterministic mdps","venue":null,"work_id":"a27deb58-ec0c-4316-afb3-a5a0f41792bc","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.820781Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:704aab9e5dc569faf3be1db443729afdb03ac5c3af4028a60596be404010a1ef","observation_id":"87b74cce-14e2-47e2-a05b-8814cb258c4c","resolution":{"observed_at":"2026-08-07T06:09:22.441791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.416540Z","title":"Optimistic pac reinforcement learning: the instance-dependent view","venue":null,"work_id":"04eb0142-efa3-463a-81ea-efb41e6c376d","year":2023},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.825041Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:1c7ef75672709982beec31b93d6ae23c30d4b4d74adbb4878f4caa78beb181e7","observation_id":"646c21e6-60f6-4282-ba5a-dbe02e9614a8","resolution":{"observed_at":"2026-08-07T06:09:22.422810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.398243Z","title":"Reinforcement learning with logarithmic regret and policy switches","venue":null,"work_id":"3da73368-9e80-4659-84fb-e0cc71eed2dc","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.830888Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:495d93e1dacbed41d859f2bba1ef4cddb73b4108133063b407c37517719ed035","observation_id":"665fbd0f-d338-43cc-89fe-2f62a84c2986","resolution":{"observed_at":"2026-08-07T06:09:22.403477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.382395Z","title":"Instance-dependent near-optimal policy identification in linear mdps via online experiment design","venue":null,"work_id":"1851edef-a796-4ebd-b40b-f4e760c950ba","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.835885Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:86cf9500b87c1cf9b3e2d39ca8405ba7152bf7fbcfd26ad017708f0f0af66ea4","observation_id":"a4fba1ab-3745-4ef1-9a60-f3f745eabfc8","resolution":{"observed_at":"2026-08-07T06:09:22.387794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.365269Z","title":"First-order regret in reinforcement learning with linear function approximation: A robust estimation approach","venue":null,"work_id":"845b5270-9e01-4b9d-bd94-6fb039a32839","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.841054Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:47f625dbe786abd82d16335a46ae4573fad81706b05e5b2566471c88c54d8dff","observation_id":"c96a5531-24de-4071-ac6b-bb1c7376ee50","resolution":{"observed_at":"2026-08-07T06:09:22.371017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.347475Z","title":"Beyond no regret: Instance-dependent pac reinforcement learning","venue":null,"work_id":"83212903-2f03-4b3b-9fc2-c237fd333d94","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.846110Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:67f2950e6ad79490666d14b7c95970f65ee84185f9748fe54333c1fb1ce0dc8c","observation_id":"343a71d3-ab56-4d4c-a37e-13f8cab7b505","resolution":{"observed_at":"2026-08-07T06:09:22.352868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.329425Z","title":"On gap-dependent bounds for offline reinforcement learning","venue":null,"work_id":"d6dadf33-4a92-40dc-ae28-a5b0f67d4fff","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.851766Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:75aff0ee42185970796fc2fee485e602c41f2f92a89f6a78949506408ed54963","observation_id":"587e52c9-d96d-4887-80a9-2f0250ffdba0","resolution":{"observed_at":"2026-08-07T06:09:22.335760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.311544Z","title":"Near-optimal randomized exploration for tabular markov decision processes","venue":null,"work_id":"50bc732e-27fe-40fe-85be-d6d599c5d874","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.857671Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:4d2d07a47b99837e1423d9f1ea3900a6bc3076d0616ae85fcf473adc1eddadf2","observation_id":"0c2295a7-13c1-4934-a9f2-7106bdeb9912","resolution":{"observed_at":"2026-08-07T06:09:22.318255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.293899Z","title":"Fine-grained gap-dependent bounds for tabular mdps via adaptive multi-step bootstrap","venue":null,"work_id":"e2275360-a464-45d3-9d84-127d5c413571","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.863405Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:451b788d1722dc2f266e0f5a6a0c247a88a58012fa80fa8b7b382d32c632ada7","observation_id":"ee3fccd1-e11e-4db4-9784-a506b0ca06b9","resolution":{"observed_at":"2026-08-07T06:09:22.300451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.272585Z","title":"Q-learning with logarithmic regret","venue":null,"work_id":"bcff32cb-cc70-4ca2-a417-63ad25cb50d3","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.868774Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:fb1687a91d57186f748e5f91eaec1b9dc028716275d8316fe36434b26219b258","observation_id":"c561d791-c61e-41ee-922e-0c6d2e04dd84","resolution":{"observed_at":"2026-08-07T06:09:22.279268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.875678Z","title":"Tighter problem-dependent regret bounds in reinforcement learning without domain knowledge using value function bounds","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.875678Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:02bdb0f20d045ab82c38c8c87034d028df4c11a4dbc5b2967bfb853e193235df","observation_id":"e09e3872-2afb-4001-84da-90d806ce96b6","resolution":{"observed_at":"2026-08-07T06:09:21.875678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.237977Z","title":"Regret minimization for reinforcement learning by evaluating the optimal bias function","venue":null,"work_id":"ea34416e-3813-4fa8-a6d6-6dfc0e4a4a8c","year":2019},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.882653Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:33fbbc443371dea69febff7e3a5991a0be6ec9eeb31fa4f22a869d327b3225dd","observation_id":"1fdf739b-4ba0-4d61-acb9-a387c1a54368","resolution":{"observed_at":"2026-08-07T06:09:22.246652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.216018Z","title":"Almost optimal model-free reinforcement learningvia reference-advantage decomposition","venue":null,"work_id":"1f986fcb-90ae-4950-87db-88ddc7d4376f","year":2020},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.889570Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:cd4b0962b90d707ff30b23bd7b3575aa694787a901688931df3dfe1ccbc2fdb1","observation_id":"03367650-80df-4da6-97d3-4005db1289cb","resolution":{"observed_at":"2026-08-07T06:09:22.224318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.197493Z","title":"Is reinforcement learning more difficult than bandits? a near-optimal algorithm escaping the curse of horizon","venue":null,"work_id":"84acab0b-c1c1-4571-9cb8-f0389a9f8563","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.897012Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:0c7ab3dc1857a552bd4aa3620ccbdd66b0378fa6f8fee1f6b9478219333c1b98","observation_id":"a62ee762-7be0-4634-a9f7-806d703c4041","resolution":{"observed_at":"2026-08-07T06:09:22.203614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.177062Z","title":"Improved variance-aware confidence sets for linear bandits and linear mixture mdp","venue":null,"work_id":"e6ef8fa0-a05b-4015-bd6c-c090b163d013","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.903919Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:1b8b6af8e59f6747ae3b0a28849718e024aa723695d4c978f7eac44b7f6f6d6e","observation_id":"eb10c7a5-ddd7-49d9-9810-6017f98d517a","resolution":{"observed_at":"2026-08-07T06:09:22.184382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.158135Z","title":"Horizon-free reinforcement learning in polynomial time: the power of stationary policies","venue":null,"work_id":"82c88030-1273-4b1b-ba44-cda3a6117065","year":2022},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.911067Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:f51b5efc86552c401b666b3f870ec59ca077bb4853ced9a86d5ab2417306aca9","observation_id":"437ff0ee-9e1e-4079-b4c7-1dd3ac6a4efa","resolution":{"observed_at":"2026-08-07T06:09:22.165150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.917081Z","title":"Settling the sample complexity of online reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.917081Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:38debc09aecda82a790def4ee1bc635872998361a3a2e22a7d36f6ea3af2abe8","observation_id":"744f8b4a-6ecc-44b7-bd4a-b4cd2893f646","resolution":{"observed_at":"2026-08-07T06:09:21.917081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07574","last_updated":"2025-03-10T03:04:21Z","snapshot_observed_at":"2026-07-31T01:34:28.561193Z","submitted_at":"2024-10-10T03:19:46Z","title":"Gap-Dependent Bounds for Q-Learning using Reference-Advantage Decomposition","version":2},"cited_work":{"arxiv_id":"2410.07574","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.07574","snapshot_observed_at":"2026-08-07T06:09:21.982126Z","title":"Gap-Dependent Bounds for Q-Learning using Reference-Advantage Decomposition","venue":"stat.ML","work_id":"d0e75a17-3a9f-4de2-a84e-32eab5035038","year":2024},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.923994Z"},"links":{"cited_paper":"/paper/2410.07574","citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:0bd5bc6a54938e5b70c9885b562747fb3c3e7984c5eabe0c97a669d179e3b8e9","observation_id":"b1f3bd36-1d48-4a40-8458-ac15aa3701e9","resolution":{"observed_at":"2026-08-07T06:09:21.992642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:22.126845Z","title":"Nearly minimax optimal reinforcement learning for linear mixture markov decision processes","venue":null,"work_id":"1a6f4f15-25ef-4563-870c-1f29d254a55f","year":2021},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.931913Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:49739489792a9bd0279cb831274454daead1861bdfdc13446d7a4a741e0041a7","observation_id":"a74689ed-21ec-46a7-a988-4e5560f21227","resolution":{"observed_at":"2026-08-07T06:09:22.133022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:09:21.939768Z","title":"Sharp variance-dependent bounds in reinforcement learning: Best of both worlds in stochastic and deterministic environments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T06:09:21.939768Z"},"links":{"citing_paper":"/paper/2506.06521"},"observation_digest":"sha256:15a2f743a1a85a45ce493fc65df5304d55bbaee90db9aef186ceb396e5b18574","observation_id":"46abb972-bf09-441b-a206-dd59d2d18436","resolution":{"observed_at":"2026-08-07T06:09:21.939768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06521","last_updated":"2025-06-06T20:33:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T16:23:22.535715Z","submitted_at":"2025-06-06T20:33:57Z","title":"Sharp Gap-Dependent Variance-Aware Regret Bounds for Tabular MDPs"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":3,"verified_fuzzy":38},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2506.06521."}