{"as_of":"2026-08-19T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa8cf27b28c3dd6fd1b234b95b415e850b9c54bb320c82bd50e700770a2cd02a","coverage":[{"denominator":109,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:19:16.651877Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.02089/citation-record","integrity":"/paper/2501.02089/integrity","json":"/paper/2501.02089/citation-record.json","paper":"/paper/2501.02089"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.208948Z","title":"Im- proved algorithms for linear stochastic bandits","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.208948Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:aa979b37ad78b9f03cd527ece3b331bacfac6f02774ff9a154f6a9c64e86ac26","observation_id":"8cd67070-287d-4075-be8a-2fa3de722aa9","resolution":{"observed_at":"2026-08-10T22:19:16.208948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.214445Z","title":"Model-based reinforcement learning with a generative model is minimax op- timal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.214445Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:dc08ee1c6f074c4e7dab697c5267808e0709123c5156c1c239efa35f47e058ca","observation_id":"1529a580-e3fc-49a1-886e-e55ef4ae0448","resolution":{"observed_at":"2026-08-10T22:19:16.214445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.219509Z","title":"Degenerate nonlinear programming with a quadratic growth condition","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.219509Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:aafdf4773bbd1b8946b255ade2b3c1cbf703bd8bbfd850984071d4934b6962c3","observation_id":"d79c0843-8f33-40dc-b94f-c4a8d025be67","resolution":{"observed_at":"2026-08-10T22:19:16.219509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.225342Z","title":"Fitted q- iteration in continuous action-space mdps","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.225342Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:52b077fd20c03a25f1322665ad1d2b2105d26743d6d69fb80fca7d712d4849e2","observation_id":"c4dce0c3-ce49-4107-bfd8-61e49fb6134b","resolution":{"observed_at":"2026-08-10T22:19:16.225342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.230182Z","title":"Learning the target network in function space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.230182Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c0ce5822802d735751344925ac6e4332a81b0ceb855d870e4cfdeed33bbc3fcd","observation_id":"1b85e5d2-4428-4f56-bda2-9ae3cc6a4408","resolution":{"observed_at":"2026-08-10T22:19:16.230182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.234126Z","title":"Finite-time analysis of the multiarmed bandit problem, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.234126Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ed2bc5bcb3d1b27c5e0ac9e13e685408f76dcd6f6bf5abf1ff1560c6b94e0c30","observation_id":"95f88b01-9202-49e2-ad3c-3b1126b78f35","resolution":{"observed_at":"2026-08-10T22:19:16.234126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.238833Z","title":"Minimax regret bounds for reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.238833Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:eb5aa6c23fbba5ec0757f8f2a625bb023edcc0d992dd4d0d2b73f2f5ec8a3608","observation_id":"4bfac92d-a9d1-4350-9b10-538a891de260","resolution":{"observed_at":"2026-08-10T22:19:16.238833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.242675Z","title":"Prov- ably efficient q-learning with low switching cost","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.242675Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:226531791a886c83303c4fb013877104fb887e6a18bea51416ab5746e6b91ebd","observation_id":"612dbc69-42f1-4026-aac5-f9cb2c4542aa","resolution":{"observed_at":"2026-08-10T22:19:16.242675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.247682Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.247682Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:75db0caff22c24345ff2cd48dc1b86df5f0dc58446d042db6482f4c8b4902268","observation_id":"391d16ad-2c33-4164-bce9-9a283ade1ad1","resolution":{"observed_at":"2026-08-10T22:19:16.247682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.252535Z","title":"Dynamic programming","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.252535Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:cb9272421a03e1fd9a6505679b0cb5d7e45d5742e8772d3687bc137026c7a4f5","observation_id":"6fed46ad-9f26-4721-a0fd-d6a4296b182e","resolution":{"observed_at":"2026-08-10T22:19:16.252535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.257046Z","title":"Online learning with switching costs and other adaptive adversaries","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.257046Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:2264689030c34de065e75abaf3e7c3baa892f36cc75e23d529e9437464c2403a","observation_id":"2d5bcf53-36f9-43ae-95c6-59bda6936c10","resolution":{"observed_at":"2026-08-10T22:19:16.257046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.261458Z","title":"Information-theoretic considera- tions in batch reinforcement learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.261458Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:22198ff2569fa23d07c7d0a9020a59f788e4cd62a4d3013078fa6b59ed42db11","observation_id":"579c1e47-5e27-49f6-b5c0-15309c726438","resolution":{"observed_at":"2026-08-10T22:19:16.261458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.265753Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.265753Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:f86d50d0ab96b19c710970be6adc5f8204c11094f1cbfe9b658cccb973bd6e8d","observation_id":"6e30b8fe-222f-4a3d-8460-5f0773f20b1e","resolution":{"observed_at":"2026-08-10T22:19:16.265753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01380","last_updated":"2024-10-09T00:58:22Z","snapshot_observed_at":"2026-08-18T09:48:03.141883Z","submitted_at":"2023-10-02T17:42:01Z","title":"Pessimistic Nonlinear Least-Squares Value Iteration for Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01380","snapshot_observed_at":"2026-08-10T22:19:16.269952Z","title":"Pes- simistic nonlinear least-squares value iteration for offline rein- forcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.269952Z"},"links":{"cited_paper":"/paper/2310.01380","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:644dade8f0356575fd81b34a9ad32da628d6928aff7c19d3f4fe3172091e5710","observation_id":"b77f5264-9dea-4525-966d-53eb0a2c6bb8","resolution":{"observed_at":"2026-08-10T22:19:16.269952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.274588Z","title":"Minimax-optimal off- policy evaluation with linear function approximation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.274588Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:aa767fca57be1628f43799852d4023db16026bc76ececebefb5b991b7c5ca4f5","observation_id":"30728537-2956-4a7d-9cae-85becbeb2052","resolution":{"observed_at":"2026-08-10T22:19:16.274588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1103.4601","last_updated":"2011-05-06T02:38:18Z","snapshot_observed_at":"2026-08-15T04:51:29.366364Z","submitted_at":"2011-03-23T19:37:45Z","title":"Doubly Robust Policy Evaluation and Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1103.4601","snapshot_observed_at":"2026-08-10T22:19:16.279147Z","title":"Dou- bly robust policy evaluation and learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.279147Z"},"links":{"cited_paper":"/paper/1103.4601","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:6cfb5e1d93c0473370e1dbd28134ea669c4067e1307e53b8e4b24a76a407a83a","observation_id":"2f664f1a-61d3-4d8b-b260-dafc2f2b3c11","resolution":{"observed_at":"2026-08-10T22:19:16.279147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.284580Z","title":"Tree-based batch mode reinforcement learning","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.284580Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:f76401b2635f585557d3fd741de75951347f61dd4bfd6d1fa1b896c11be38a9a","observation_id":"9ff4366c-7ce2-4045-b441-874bd0c7ad4b","resolution":{"observed_at":"2026-08-10T22:19:16.284580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.289795Z","title":"Discovering faster matrix multipli- cation algorithms with reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.289795Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:f2603e6e95baf55dfed03ad889417b7c332729d1bbf2f00f69a46eda3f5edcd3","observation_id":"3e421dd0-e1f5-4858-aff6-0396b456a2f3","resolution":{"observed_at":"2026-08-10T22:19:16.289795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.294226Z","title":"Theory of statistical estimation","venue":null,"work_id":null,"year":1925},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.294226Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:6f48e00a4e2aa636c292050e47e5edbd6fba37fcfe1a793280e3b3435237e949","observation_id":"1547a81a-a1db-4e9e-8690-9deba09ac06b","resolution":{"observed_at":"2026-08-10T22:19:16.294226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00494","last_updated":"2021-01-02T18:41:27Z","snapshot_observed_at":"2026-08-16T18:54:38.869957Z","submitted_at":"2021-01-02T18:41:27Z","title":"A Provably Efficient Algorithm for Linear Markov Decision Process with Low Switching Cost","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00494","snapshot_observed_at":"2026-08-10T22:19:16.298033Z","title":"A prov- ably efficient algorithm for linear markov decision process with low switching cost","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.298033Z"},"links":{"cited_paper":"/paper/2101.00494","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ee18aed20e32ddc2bb8985d2486dff9ff54270a5589d404d293e49788674cda0","observation_id":"b23adf15-01b8-408c-ba93-c0a3705e9685","resolution":{"observed_at":"2026-08-10T22:19:16.298033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.302003Z","title":"Batched multi-armed bandits problem","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.302003Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:13fc9625a7baa6a42aa372ed83766128bb72d3d8455cc070dfc819ccc043552f","observation_id":"6db73a91-af48-4e56-80e4-676867e272e1","resolution":{"observed_at":"2026-08-10T22:19:16.302003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.305987Z","title":"Off-policy deep rein- forcement learning by bootstrapping the covariate shift","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.305987Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:b0d350866eb686bc56454fd5a39c9b792be1194c5dd92ce39a40c75967da6dbf","observation_id":"cac3d414-6306-424a-b5bb-2427cbdfb052","resolution":{"observed_at":"2026-08-10T22:19:16.305987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.311486Z","title":"Minimax pac bounds on the sample complexity of rein- forcement learning with a generative model","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.311486Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:b864872b91705968de38555c6a33f935c342d90ba9178297b75e656ae0c11bbf","observation_id":"961f3efe-270f-40b7-9217-70dd5c1cf63b","resolution":{"observed_at":"2026-08-10T22:19:16.311486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.317103Z","title":"Maxmin expected utility with non-unique prior","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.317103Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8824867df061a0db2411b22f442a487a9ea7be00b3a56b75d1ee814bf7707c66","observation_id":"689b4757-97cd-4604-b07c-f3f151f94402","resolution":{"observed_at":"2026-08-10T22:19:16.317103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.321994Z","title":"Approximate solutions to Markov decision processes","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.321994Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:13d12a5bbd0134476e8a2babefbcf749dc73e6dc485487103edb07ca3e981a4d","observation_id":"1b6a0a7d-db16-4d7a-98c6-b9ab21630074","resolution":{"observed_at":"2026-08-10T22:19:16.321994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.326694Z","title":"Networkgym: Reinforcement learn- ing environments for multi-access traffic management in net- work simulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.326694Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:324296392af8047a69450477a7c9a9ee819dfb75cccb7f8bea5fc02da1649369","observation_id":"2fe80bfc-4112-4f5f-b37b-55194084191d","resolution":{"observed_at":"2026-08-10T22:19:16.326694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.331632Z","title":"Consistent on-line off-policy evaluation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.331632Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:48e875d1353134978842e657d685e8ddf3939b744f43e3f7e05b7a7cc5e1ac19","observation_id":"60ca303f-2507-4a8c-a827-34d6d588f2ca","resolution":{"observed_at":"2026-08-10T22:19:16.331632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.336214Z","title":"Bootstrapping fitted q-evaluation for off- policy inference","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.336214Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:56cab344dd97ef3e5275a9cff9872971d61914304f75bb81cd2dde594ce843ff","observation_id":"05eb0f54-0dd3-451b-b852-3dffe9027cc4","resolution":{"observed_at":"2026-08-10T22:19:16.336214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.340340Z","title":"Effi- cient estimation of average treatment effects using the estimated propensity score","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.340340Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:be4217e68766c5fb5df7eb0019d8550312a9844d53f39cd838226e276f90bbd3","observation_id":"667d8a66-1ef5-4361-8463-37b978db587a","resolution":{"observed_at":"2026-08-10T22:19:16.340340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.344523Z","title":"A generalization of sampling without replacement from a finite universe","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.344523Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c82baa2e7ea7c0cf6eebaad4de1ab0cf047afbb283315c9333e8e28b1a426433","observation_id":"d26e45f8-545a-4681-901f-2b34b8f84dab","resolution":{"observed_at":"2026-08-10T22:19:16.344523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.348936Z","title":"Towards deployment-efficient reinforcement learning: Lower bound and optimality","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.348936Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:def795975d65edbd388d9ba7b0fd8a75b197f73d9891cbd7c4e1e3a77c759867","observation_id":"f0b9d2f9-6be9-4d6c-b1c6-7370f8df9449","resolution":{"observed_at":"2026-08-10T22:19:16.348936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.353131Z","title":"Aleatoric and epis- temic uncertainty in machine learning: An introduction to con- cepts and methods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.353131Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ddb36ddb075ef505273c7248479d63f21c29bcd46f4c899b6b6fc449d8f8976e","observation_id":"043356c3-92bf-4056-b959-a07c8de46a47","resolution":{"observed_at":"2026-08-10T22:19:16.353131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.784537Z","title":"Doubly robust off-policy value eval- uation for reinforcement learning","venue":null,"work_id":"bddf9afc-5f95-4961-8fd9-e570ac7ba82a","year":2016},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.357051Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:03aa195ed63d365b94d92ead4f7165e22cb9eae401a37788c245b9a4861b34a1","observation_id":"4c4b3a65-6f0c-404d-aa1f-1ff225bc51bd","resolution":{"observed_at":"2026-08-10T22:19:17.788348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.770890Z","title":"Offline reinforcement learning in large state spaces: Algorithms and guarantees","venue":null,"work_id":"ef5c8846-f33d-48ed-9628-c03765ac825b","year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.360774Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:3acd1d70a758bafe5cc70f37f7020493d7d73ab8ba651892ab67119cf7273a83","observation_id":"e6085e59-902e-41c4-91d9-e09f3fc8ff07","resolution":{"observed_at":"2026-08-10T22:19:17.775309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.757670Z","title":"Is pessimism provably efficient for offline rl? In International Conference on Machine Learning, pages 5084–5096","venue":null,"work_id":"eec0be75-1b51-49b7-b6c7-47f965855e42","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.365059Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:342e334be0e48d8ea14d409d416fff7909a6334028ef80f6a528e02a0609972e","observation_id":"f52c8254-9bed-41b8-9dff-eb535d10df04","resolution":{"observed_at":"2026-08-10T22:19:17.761998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.744376Z","title":"Double reinforcement learning for efficient off-policy evaluation in markov decision processes","venue":null,"work_id":"0eea0a64-7407-4733-8f12-cf0621bcbca4","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.369711Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:1cb60775fad09e73c8eba64fc498888b3fcda923676259062b855ac17b8f702e","observation_id":"b8a3ab84-a748-4bcd-b827-85ff45cac308","resolution":{"observed_at":"2026-08-10T22:19:17.748834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.730633Z","title":"Efficiently breaking the curse of horizon in off-policy evaluation with double reinforce- ment learning","venue":null,"work_id":"a0520a72-1650-42eb-ae00-b0cc108cd935","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.373992Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:ea5876a2541d7ede15b61bba777ae9d92e6a23714e8a9a430fe3c7f569ef4695","observation_id":"5a83a642-146b-4251-9a99-64b8b41d7be2","resolution":{"observed_at":"2026-08-10T22:19:17.735715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.718353Z","title":"Near-optimal reinforce- ment learning in polynomial time","venue":null,"work_id":"96e5640b-43fc-4755-bfcb-d395b0a635e5","year":2002},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.378249Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:3e329b3e73643a5ef940e14ae09507a185f9d72b782835e92823097f3c0788ad","observation_id":"bafe5139-e632-4f6d-8cb9-5edc5238010c","resolution":{"observed_at":"2026-08-10T22:19:17.722332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.706176Z","title":"Introduction to empirical processes and semiparametric inference, volume 61","venue":null,"work_id":"9a209f0f-456b-4226-a572-78a16c6c33e6","year":2008},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.383340Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:7f5571f5f18ad8a764b6c43ce32cf72d3a4f7aeadf69f037770ae6d31139207d","observation_id":"6226483e-26dc-4d44-9f62-557c512b6647","resolution":{"observed_at":"2026-08-10T22:19:17.710137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.693740Z","title":"Offline reinforcement learning with fisher divergence critic regularization","venue":null,"work_id":"96350c9a-6f92-43b9-883c-4f149967167a","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.387687Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:fdbfcc7b9b37d0baa57553f9416baa71e69682bb8092494744338a0dd54ca992","observation_id":"8641d3d2-57e5-4f99-8e8a-5d4477510b90","resolution":{"observed_at":"2026-08-10T22:19:17.698074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.680445Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":"713d4b4b-1d03-4de6-b1b9-488858e7a655","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.391784Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:2c1a56beff11b660caa81743b6ed43ba956626cc7a951808d42fc4be8b05b946","observation_id":"0663e18c-acf2-4cba-9ed9-b16a229433a0","resolution":{"observed_at":"2026-08-10T22:19:17.685186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.667242Z","title":"Minimax theory","venue":null,"work_id":"ebb305bd-4cd0-4ced-912c-fc8952ed2263","year":2008},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.395913Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:786c3af2f38b9604db44bf9869dad60772155ee19b3bebd880b74a942f277ee9","observation_id":"3aa17862-1c9b-4384-92c8-b34eecdbfe0a","resolution":{"observed_at":"2026-08-10T22:19:17.671509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.654069Z","title":"Batch policy learning under constraints","venue":null,"work_id":"6d0cba9a-6556-4ee8-ba95-210353c6c68c","year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.400745Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:51ea4ed28709c853cc220ca07d64d4bc83f70d279d03b3a02c4fb2bdf1ffbe71","observation_id":"9a2ba5fa-fec8-4916-8dc0-a6bd09c3fd44","resolution":{"observed_at":"2026-08-10T22:19:17.658549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-10T22:19:16.405537Z","title":"Offline reinforcement learning: Tutorial, review, and perspec- tives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.405537Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8f68080bea632584235094791a00f1752a19f0c98db4270318f056c355dc1aaa","observation_id":"53fbf41f-b39e-4273-baa9-63ed9b715275","resolution":{"observed_at":"2026-08-10T22:19:16.405537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.641448Z","title":"Breaking the sample size barrier in model-based reinforcement learning with a generative model","venue":null,"work_id":"90abe7eb-faec-406c-954f-f634a9c98f8d","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.410690Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:6c81dbaf7773e0a13a2a69e9ffd7b9d1f7e97cfbd75e1db0bfdcc766becbda64","observation_id":"215ce0da-c7fa-4b64-8547-77caf4e57389","resolution":{"observed_at":"2026-08-10T22:19:17.645299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.628872Z","title":"Offline reinforcement learning with closed-form policy improvement operators","venue":null,"work_id":"11770b21-3f3b-42d3-b2be-6246e2c9d7f4","year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.415116Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:3a3d22059b1f13deb3dfc75cec0a1a5ec2474b2957b590906801ebf55a2c749e","observation_id":"49255547-06f2-4497-9765-454caa65547e","resolution":{"observed_at":"2026-08-10T22:19:17.632786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.616736Z","title":"Unbi- ased offline evaluation of contextual-bandit-based news article recommendation algorithms","venue":null,"work_id":"f2a03efd-451d-4ebd-bfde-878a9925dcc9","year":2011},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.419615Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:a0ebd044d70f7bd9307f667fe04bdb30026798307cc0488132fdf37f8eda6068","observation_id":"f09321f7-cc91-43c8-804d-e6d4873c4936","resolution":{"observed_at":"2026-08-10T22:19:17.620627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.603487Z","title":"Monte Carlo strategies in scientific computing, volume 10","venue":null,"work_id":"b925e4d3-a4a0-4038-aa12-83779e307585","year":2001},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.423566Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:1bb7d374a327db202b8346b17d63bd1e23722d7de269d5f8061ed259f598b887","observation_id":"9a16b704-7ff1-4654-80e9-82d0632306c6","resolution":{"observed_at":"2026-08-10T22:19:17.608305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.590659Z","title":"Breaking the curse of horizon: Infinite-horizon off-policy es- timation","venue":null,"work_id":"b55b8c95-197f-48bd-b4ca-ce3ae54a8a87","year":2018},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.427799Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:34d78e5af414fd46e261c2e1a24f3bf039f57c0668eb51ea7409eaec199a981e","observation_id":"78954958-2c3a-4b48-8a42-23141e5ff526","resolution":{"observed_at":"2026-08-10T22:19:17.595029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.576718Z","title":"Off-policy policy gradient with stationary distribution cor- rection","venue":null,"work_id":"fa8a8dcd-1411-4f46-96a5-f6c894b076a8","year":null},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.432172Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8f29f14e68dd67d70d8f610525e6bd18d730b08bcd0d821eb789320059b47f4e","observation_id":"57a75e49-66aa-434d-9959-297a5db9a7af","resolution":{"observed_at":"2026-08-10T22:19:17.581997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.563307Z","title":"Provably good batch off-policy reinforcement learning without great exploration","venue":null,"work_id":"789069c1-7847-4f24-94ec-4cd0211faa23","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.436590Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:d58010f80972b3738b955973081ef4ae05f5eb38309f2beeca42fbfa8dc8dda6","observation_id":"ae97e546-50b3-4c9b-bf78-01671a0aa7ee","resolution":{"observed_at":"2026-08-10T22:19:17.567624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.550297Z","title":"Mildly conservative q-learning for offline reinforcement learning","venue":null,"work_id":"dec37a8c-3496-48d2-baf0-989fc6bbd890","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.441947Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:51c0917f22015ca2a230c41e996014ecfed7cf138efcfe8a8be96aa2948e9b5f","observation_id":"405675f4-ba25-4549-8375-532ad9945af0","resolution":{"observed_at":"2026-08-10T22:19:17.554612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.538083Z","title":"the distribution-norm to the res- cue","venue":null,"work_id":"1316caac-55f9-4ddf-a520-febd526c2296","year":2014},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.446115Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:fa09f5ceed8be29234634c1a31fb9ad3df368b4bc214153a23c43114f5667cc8","observation_id":"9e7b0ac0-cd9f-41d8-acd5-3af09958e87e","resolution":{"observed_at":"2026-08-10T22:19:17.541828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.525240Z","title":"Faster sorting algorithms discovered using deep reinforcement learn- ing","venue":null,"work_id":"01cff58b-e563-4a97-89a2-27a4ebf77e5b","year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.450397Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:cf702c8e7e1bd2d394a8267106efbf3d789416f6a07bc1560dfd6537093179d4","observation_id":"54ed687c-d2c2-46b3-a236-996f74795263","resolution":{"observed_at":"2026-08-10T22:19:17.529395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.511836Z","title":"Neural adaptive video streaming with pensieve","venue":null,"work_id":"37118f5b-6d0d-44d7-a0bd-45a32bcb5814","year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.455122Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:02db9f0b52e972ba056ce928d195afd8a663910d6c3ab3f6dcaf13e5dadc8b9e","observation_id":"1e0d4ece-f616-4e4f-81d8-bdb7858b2412","resolution":{"observed_at":"2026-08-10T22:19:17.516072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.496180Z","title":"Deployment-efficient reinforce- ment learning via model-based offline optimization","venue":null,"work_id":"57820859-d589-4b17-9f3a-6e0def97ea7d","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.459496Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c7f8c92ccb0542665d7b1b238a27779d3d0cc906573c9b2e759ad8d1fd57e50e","observation_id":"8b2e305d-de76-487c-835f-3755f4a0be3a","resolution":{"observed_at":"2026-08-10T22:19:17.502046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.483513Z","title":"Dependent central limit theorems and in- variance principles","venue":null,"work_id":"e48a203b-b785-4d2b-bc83-64f764a5776d","year":1974},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.464018Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:f2d372c295c99f06657caad59c6b553e46dae066da4eaed29b1e1ecb3570e160","observation_id":"cb40f6e4-1f27-4e42-bff5-f758f1b319b9","resolution":{"observed_at":"2026-08-10T22:19:17.487751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.471792Z","title":"Variance-aware off-policy evaluation with linear function ap- proximation","venue":null,"work_id":"7b8ca078-62e7-4733-bd39-444d24430f4c","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.468042Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:3022630664e7a07b0b4fc5ff97853701c1daf58ee3032b6f23800c213c3f815f","observation_id":"58ccbf41-73d4-412d-89f5-14b877a01c8b","resolution":{"observed_at":"2026-08-10T22:19:17.475680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.459016Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":"384215ea-1a43-437b-a641-60ed625ffdec","year":2015},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.471469Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:7e919f40fc5cbc6b2518688e551e3efa2300f937370d2dd9029b945b9ee32bb8","observation_id":"e34d18aa-ef27-4d2a-9fb0-74054f8e5149","resolution":{"observed_at":"2026-08-10T22:19:17.462963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.446611Z","title":"Bootstrapping: A nonparametric approach to statistical infer- ence","venue":null,"work_id":"a5308012-ead4-4758-b244-c1ced051bb06","year":1993},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.475970Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:2cf382cad9e9f1e4537c30de111647950dd0f0c3ba639144fc8d7a67ccbb6299","observation_id":"dd6bb0c5-0cfa-427b-b9ca-0fed1a73afff","resolution":{"observed_at":"2026-08-10T22:19:17.450599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.432888Z","title":"Finite-time bounds for fit- ted value iteration","venue":null,"work_id":"696f3c43-fc0a-4814-b2cd-fa9241ee0a0c","year":2008},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.479912Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:03bc37f58868647224629fe21ea559112d5cc73a5eaf554e602b94d9d44311ba","observation_id":"e59f5fa6-37ca-4640-8f65-b706af237290","resolution":{"observed_at":"2026-08-10T22:19:17.437575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.417821Z","title":"Marginal mean models for dynamic regimes","venue":null,"work_id":"3bcb76ee-b246-423b-9d9e-d8fdedacb38a","year":2001},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.483698Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:903b36f312452e5c31bd8041c919076d055b8b8044a4f24db9464f80462ddbd2","observation_id":"193c6ec1-b31e-4457-95f6-cac07abce26a","resolution":{"observed_at":"2026-08-10T22:19:17.422478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.403867Z","title":"Dualdice: Behavior-agnostic estimation of discounted stationary distribu- tion corrections","venue":null,"work_id":"c5ff9a6a-6de1-4ed6-bd55-9b4d9e583f5e","year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.487956Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:f1a23889d6cc6c2f9d705eca373adbd9c52f08421fbb61161aab3a34db656c66","observation_id":"3ccf2f67-d769-44e9-9bce-ee8a2068faaf","resolution":{"observed_at":"2026-08-10T22:19:17.409007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-18T04:12:50.632095Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-10T22:19:16.491915Z","title":"Algaedice: Policy gradient from ar- bitrary experience","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.491915Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:61b465d5c621265554294e550d24878fc08810d5968c9e640db6b8af3dc11492","observation_id":"95de1a03-1199-4c28-ad5b-2985258fee37","resolution":{"observed_at":"2026-08-10T22:19:16.491915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.390539Z","title":"Optimal medication dosing from suboptimal clinical ex- amples: A deep reinforcement learning approach","venue":null,"work_id":"437ae357-5435-4be5-a1cd-062c14a98713","year":2016},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.497573Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:641867a67f968f42ea48a3d78272596dcce0eba786b5d41ac4476aee66906ee0","observation_id":"b0d4c04b-e228-4175-ae87-a8383b436721","resolution":{"observed_at":"2026-08-10T22:19:17.394785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.376319Z","title":"On sample-efficient of- fline reinforcement learning: Data diversity, posterior sampling and beyond","venue":null,"work_id":"cf62ec6e-d188-4051-9889-09ce0c22b801","year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.502392Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:93c2e1d0e79c4c4c252c33e7fe901ccb71378e756ef40b35c443dfe882d98219","observation_id":"c3585e0a-0abb-469f-9e0b-71f14dfd013e","resolution":{"observed_at":"2026-08-10T22:19:17.381978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.363816Z","title":"On instance-dependent bounds for offline reinforcement learning with linear function approximation","venue":null,"work_id":"099489a6-4fe2-4c8d-be81-fcf05f047f6e","year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.507044Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:b0585e8b790f60acd22a59a755aca6fc3b8484411fa59367c028d86beb6d61cd","observation_id":"19b323a4-cbe9-4848-895f-91a27aa5631a","resolution":{"observed_at":"2026-08-10T22:19:17.368016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.350391Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":"0ab240bd-71ab-49a2-bb42-a320423990d1","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.511379Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:42c1477dbbdfa2e7b1d2084795e8d75916bf23db9922862d30d0c25026bb63f5","observation_id":"2d4b2c17-a3f3-47bd-bd3d-27744fb6f1b5","resolution":{"observed_at":"2026-08-10T22:19:17.354576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.337134Z","title":"Batched bandit problems","venue":null,"work_id":"1f81e213-4213-49ea-a65d-53c4f678128d","year":2016},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.516827Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:305f5171d376f03287724ad30bd8c6401c7908f352fbb9e15dda883d0f2d5cdc","observation_id":"2e04c9c0-c068-49f1-81b0-e36439b6e035","resolution":{"observed_at":"2026-08-10T22:19:17.341189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.321739Z","title":"Approximate Dynamic Programming: Solv- ing the curses of dimensionality , volume 703","venue":null,"work_id":"a7326743-88a9-420a-8c8a-f463c8ed144c","year":2007},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.521801Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8f74cf6a387d6d3c916481e9aa8780fc2ef3b25b648140be1669d95dbf6641f6","observation_id":"4c44f74f-5eb9-4085-b8d9-9d5dd9f2e6d4","resolution":{"observed_at":"2026-08-10T22:19:17.326945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.307242Z","title":"Eligibility traces for off-policy policy evalua- tion","venue":null,"work_id":"20b7efe8-a0f6-4705-b616-6fca67c09466","year":2000},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.525885Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c0436c44a161c44f20a2053819677590104d05fbf101787c4477bfc61bc32175","observation_id":"e5b586e5-8f70-4316-b061-bf6d2bf8990a","resolution":{"observed_at":"2026-08-10T22:19:17.311762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.294260Z","title":"Markov decision processes","venue":null,"work_id":"5e8f2174-a7dd-4906-9e48-d883ec562bde","year":1990},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.529327Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:4c13e4cfc717d5a7cd2c9791152e101c5a96e9258de2fc7247861981133b8ca5","observation_id":"45d70d9d-3624-4ccc-8f27-5dd679f15df5","resolution":{"observed_at":"2026-08-10T22:19:17.298253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.280794Z","title":"Near-optimal deployment effi- ciency in reward-free reinforcement learning with linear func- tion approximation","venue":null,"work_id":"f7926e02-9940-4e52-b151-58525c6dd88c","year":2023},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.533749Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:07570bdb3e24dc49f672be7c082fa1e6901e347a6147b484563cce80e0863c3c","observation_id":"563ed0ae-d2b1-41ed-91ff-088985f8c4ae","resolution":{"observed_at":"2026-08-10T22:19:17.285372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.265503Z","title":"Sample- efficient reinforcement learning with loglog (t) switching cost","venue":null,"work_id":"ea35ae2b-ac5c-4b95-94f5-9434a1142655","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.539089Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:607df175febda42fe4c35b0f7d37e15d5d0225957c678c91b1437634e664b028","observation_id":"5cc730c1-b9ae-4717-bff6-d5aed1d48b13","resolution":{"observed_at":"2026-08-10T22:19:17.270273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.251119Z","title":"Logarithmic switch- ing cost in reinforcement learning beyond linear mdps","venue":null,"work_id":"d6b7f3df-b705-4cff-ae53-1600b5e25f57","year":2024},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.543674Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:825413d259284df1d0b15f8c2b53d3bf3e1dffd009bb473099d28330e66526ff","observation_id":"90471ee9-5843-4fbd-be07-5c0ef964fc56","resolution":{"observed_at":"2026-08-10T22:19:17.255721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.237886Z","title":"Bridging offline reinforcement learning and im- itation learning: A tale of pessimism","venue":null,"work_id":"ce6ddd13-69f6-4abc-89ac-bf102a973a41","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.548582Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:188aef23c0bf520b49a7c5a32ff05ada30dd0539fd024da58a5b6de8ce1083b0","observation_id":"d74fba3d-d6a5-40ca-bb2e-ac5dc47a8672","resolution":{"observed_at":"2026-08-10T22:19:17.242121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.224479Z","title":"Nearly horizon-free offline reinforcement learning","venue":null,"work_id":"0ace4e46-f265-4f54-8c71-f5d8005ef688","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.553237Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:2b8d979ab9e7a183190285e3b70ba3d0f771bd5a8cb2a5d1625a17e735a4f307","observation_id":"08b9b6dd-f4fb-4a25-bcee-9eba6b35c3e6","resolution":{"observed_at":"2026-08-10T22:19:17.228950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.210631Z","title":"Mastering the game of go with deep neural networks and tree search","venue":null,"work_id":"8854c223-69b7-4a0e-b1ca-f9ded3149256","year":2016},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.558147Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:b8400421c3b63f818bfe3c7867559f8653ce13ef7a50687a8b1dcfad66ace78e","observation_id":"73f5d59e-d8e3-46ff-8735-08a530c69867","resolution":{"observed_at":"2026-08-10T22:19:17.215211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.563181Z","title":"Mastering the game of go without human knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.563181Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:7e13b736b7b1bb366c1eac1dbeef21dd8b0aa4ba05837b9e55e6f7e8be3dca96","observation_id":"60a06f68-e025-467a-9587-758852db3281","resolution":{"observed_at":"2026-08-10T22:19:16.563181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.187959Z","title":"Learning to summarize with human feed- back","venue":null,"work_id":"bf11327a-51c7-4c02-92db-22aa6bc7cb44","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.567487Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c2220b9560d23e04d548d76206c2e1ffb00194e42e9ba1d3ab2e4cc8ead68eb6","observation_id":"aa648aef-6fb2-4b3c-9e69-3af10e8a56ca","resolution":{"observed_at":"2026-08-10T22:19:17.192685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.175027Z","title":"Reinforcement learn- ing: An introduction","venue":null,"work_id":"6d167947-107c-4e5d-b65d-288bfeb5714e","year":2018},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.571125Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:f99f2732a4dbb70b9ec3a362cfc4061f283757da01aadad9a3661e3d0be308a5","observation_id":"d0e89996-56c5-4de9-b783-0482330b2bde","resolution":{"observed_at":"2026-08-10T22:19:17.179346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.162026Z","title":"Finite time bounds for sampling based fitted value iteration","venue":null,"work_id":"bd65e416-2861-45ff-b9b6-1a69cac6e6d3","year":2005},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.574853Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:a758a3d2e2c7eff1e7e5cd880729ba49e4ada2d7cb6cf5bc718a47e24c3c6da8","observation_id":"5c4d9419-5927-4a22-adc4-ac8db1fc9fd2","resolution":{"observed_at":"2026-08-10T22:19:17.166147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.578347Z","title":"Semiparametric theory and missing data, volume 4","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.578347Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:740c08c196de8f30922711e21f4d37e2cf63dec25fe1c41273b433fc90176472","observation_id":"1f620bd3-35e8-4b44-a8e0-c92594300be9","resolution":{"observed_at":"2026-08-10T22:19:16.578347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.139016Z","title":"Minimax weight and q-function learning for off-policy evaluation","venue":null,"work_id":"b0a26386-776e-4636-9e08-738d194d1c32","year":null},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.584284Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:fb55f0b408b16b2242e5f434b51da10033e0fff576a81bc5505745170ec85f18","observation_id":"5253eba6-d85a-49eb-a3e9-63f1629d1595","resolution":{"observed_at":"2026-08-10T22:19:17.143639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.125153Z","title":"Asymptotic statistics, volume 3","venue":null,"work_id":"c9e54b47-463e-43ae-a6f8-8ae677e38a97","year":2000},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.588943Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:5ed0300380f0ebd3da778996c8c2979af4c5cb77ff83b4ffc88085a344e8faa7","observation_id":"fdef9586-60e1-47ab-aaa9-a545b885a559","resolution":{"observed_at":"2026-08-10T22:19:17.129716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.111706Z","title":"High-dimensional statistics: A non- asymptotic viewpoint, volume 48","venue":null,"work_id":"d2e59918-b0bf-43c3-9beb-19795e72bb2d","year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.593223Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:988fefc1eade73b08793f7d3d3a593ed227a97a249dcce11c52034e533858015","observation_id":"f87c33c9-fd40-4ca5-8ba6-c586cc08db69","resolution":{"observed_at":"2026-08-10T22:19:17.116170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.098005Z","title":"Provably efficient reinforcement learning with linear function approxi- mation under adaptivity constraints","venue":null,"work_id":"d31f0e8d-82f7-4f9d-a355-d2b3bcd37101","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.598331Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:08e0df4b08108ccaacfc017693b302a075bcbd5a67a8c4e12d2ea56c291d29c5","observation_id":"7b684ee2-762a-4cab-bb9b-37310552c199","resolution":{"observed_at":"2026-08-10T22:19:17.102768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.084882Z","title":"On gap-dependent bounds for offline reinforcement learning","venue":null,"work_id":"89eada30-6e63-4150-9aa0-df0d7c8f680c","year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.602873Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:d7adbf54a5925b7c616d9092bf03de77fc251311f45c2bf202cda74a5cfb3d48","observation_id":"d95b0957-9ce6-4423-818d-b7197348b8e4","resolution":{"observed_at":"2026-08-10T22:19:17.088796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.071453Z","title":"Opti- mal and adaptive off-policy evaluation in contextual bandits","venue":null,"work_id":"48eaadb2-df7c-452c-be96-0a4c23fd4a13","year":null},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.607201Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:260f760a04fe13c6e23beddabb4febe3e8fe124d9a953a5d7dd9d1bb170f07f5","observation_id":"0646dc31-11d4-48ce-b901-1af3c63df95b","resolution":{"observed_at":"2026-08-10T22:19:17.075476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-10T22:19:16.611265Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.611265Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:8b82a748713d18eae0e4e5fb7c68407973d88b983d039b15c62569a5b611b8ca","observation_id":"17268b18-fa42-4ba1-9a94-47bdce98e4c1","resolution":{"observed_at":"2026-08-10T22:19:16.611265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.057052Z","title":"On the optimality of batch policy optimization algorithms","venue":null,"work_id":"2a6879bd-8eca-4212-9179-c782d8ebf280","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.615198Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:0b5dabb9a61c60752d3ad7971ae70ac92f40a491520ac78ad50a93f6f84881c1","observation_id":"4c6f5143-4834-4b7f-b907-f772f2121fc5","resolution":{"observed_at":"2026-08-10T22:19:17.061734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.043435Z","title":"Q* approximation schemes for batch reinforcement learning: A theoretical comparison","venue":null,"work_id":"f5e5299b-a29e-4287-8667-33bfbacb6d4b","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.619015Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:0e0de9831a4416d63169a74d20cc90a7014d461b5ad520583d8dda6654cf7eee","observation_id":"9757f4e0-0dbe-4062-bba3-b3cfcc744b21","resolution":{"observed_at":"2026-08-10T22:19:17.047894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.029821Z","title":"Towards optimal off-policy evaluation for reinforcement learning with marginal- ized importance sampling","venue":null,"work_id":"717c7584-5f66-4bee-b98f-b0a0d80ac592","year":2019},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.622611Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:9c73e772f4c52fecf8534c614eb24bc256b409bc150050c702b7a093927b54e4","observation_id":"189aff4c-fe89-4510-a5a7-af8d297a211c","resolution":{"observed_at":"2026-08-10T22:19:17.034006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:17.016641Z","title":"Bellman-consistent pessimism for offline rein- forcement learning","venue":null,"work_id":"ecfcb8fc-306a-4f69-a81b-1f163b77e819","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.626325Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:eaa37c7b3c5d36578956d1e4b7ca3e85d463c6153fa80345e1777252e21183d6","observation_id":"da2895fe-2f71-49aa-bfa3-6016f79f0d28","resolution":{"observed_at":"2026-08-10T22:19:17.020810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.630025Z","title":"Policy finetuning: Bridging sample-efficient offline and online reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.630025Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:711be6b5c178f7940cb9681a52bedff83a85be0202f0d4385223eb31009a14b7","observation_id":"19817067-7e7a-4a91-9f41-05d340030dd3","resolution":{"observed_at":"2026-08-10T22:19:16.630025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15512","last_updated":"2023-03-01T13:37:28Z","snapshot_observed_at":"2026-08-16T16:56:28.166638Z","submitted_at":"2022-05-31T02:50:17Z","title":"Nearly Minimax Optimal Offline Reinforcement Learning with Linear Function Approximation: Single-Agent MDP and Markov Game","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15512","snapshot_observed_at":"2026-08-10T22:19:16.633815Z","title":"Nearly minimax optimal offline rein- forcement learning with linear function approximation: Single- agent mdp and markov game.arXiv preprint arXiv:2205.15512, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.633815Z"},"links":{"cited_paper":"/paper/2205.15512","citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:06a91845cb2ddd3acbc517f30827d566836674c3556b2f4fa3b9a17438612f44","observation_id":"6064c2ed-6b28-489a-8a2b-74a6bfba6e3b","resolution":{"observed_at":"2026-08-10T22:19:16.633815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.993527Z","title":"Asymptotically efficient off- policy evaluation for tabular reinforcement learning","venue":null,"work_id":"be105f1e-e6f2-4c8e-9b33-7e991a8b7388","year":2020},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.637934Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:707a7c9cac21e13d73a610288babcd4aacc21a56437c06210c7e8cff4469e445","observation_id":"6dfea6f6-3eb1-4951-bbdd-83da7727c7d5","resolution":{"observed_at":"2026-08-10T22:19:16.998146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.980434Z","title":"Towards instance-optimal of- fline reinforcement learning with pessimism","venue":null,"work_id":"b063f1f8-d1ca-45a7-8152-d4a6d4d74496","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.643262Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:c6e6dd158d5c72ac328c1b2c0d9d82c4b4b54c2772747224fb478d5ffe8940fa","observation_id":"80472f83-d677-47e9-aeff-1e7a3590bdcf","resolution":{"observed_at":"2026-08-10T22:19:16.984804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.964969Z","title":"Near-optimal prov- able uniform convergence in offline policy evaluation for rein- forcement learning","venue":null,"work_id":"55abc23c-1468-45ea-9933-242c9632fe88","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.647430Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:0a3fb51006287e053f3562e335c392ab638ee03f7f06e531b54ffc092e6e8494","observation_id":"cc4bef7c-c292-402e-8207-a764985f2dcf","resolution":{"observed_at":"2026-08-10T22:19:16.970026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:19:16.951724Z","title":"Near-optimal of- fline reinforcement learning via double variance reduction","venue":null,"work_id":"79c27aae-89e0-4b44-aa82-44ea658a8a19","year":2021},"citing_paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-10T22:19:16.651877Z"},"links":{"citing_paper":"/paper/2501.02089"},"observation_digest":"sha256:7e084b94523e5aa8d6083856e8e82a748c00aa411f0bbe75937d0e450976fe95","observation_id":"5397d07a-78d9-4e51-baa1-2aa64fa26568","resolution":{"observed_at":"2026-08-10T22:19:16.955788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.02089","last_updated":"2025-01-03T20:27:53Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T03:44:35.658494Z","submitted_at":"2025-01-03T20:27:53Z","title":"On the Statistical Complexity for Offline and Low-Adaptive Reinforcement Learning with Structures"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":61},"total_outbound_references":109},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 109 outbound references and 0 inbound Pith citation observations for arXiv:2501.02089."}